arXiv大型語言模型
伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
Telescopic Language Models: One Training Run for Endless Compute Budgets
這項研究提出 Telescopic Language Models (TLM),透過隨機前綴監督與完整錨點訓練,讓單一 Transformer 模型在任何深度皆能作為有效的語言模型運作,不需為多種運算預算重複進行訓練或壓縮。
2 分鐘閱讀
#efficient-inference
1 篇文章
Telescopic Language Models: One Training Run for Endless Compute Budgets
這項研究提出 Telescopic Language Models (TLM),透過隨機前綴監督與完整錨點訓練,讓單一 Transformer 模型在任何深度皆能作為有效的語言模型運作,不需為多種運算預算重複進行訓練或壓縮。