伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
Telescopic Language Models: One Training Run for Endless Compute Budgets
這項研究提出 Telescopic Language Models (TLM),透過隨機前綴監督與完整錨點訓練,讓單一 Transformer 模型在任何深度皆能作為有效的語言模型運作,不需為多種運算預算重複進行訓練或壓縮。
#transformer
4 篇文章
Telescopic Language Models: One Training Run for Endless Compute Budgets
這項研究提出 Telescopic Language Models (TLM),透過隨機前綴監督與完整錨點訓練,讓單一 Transformer 模型在任何深度皆能作為有效的語言模型運作,不需為多種運算預算重複進行訓練或壓縮。
New LoRA Skills Should Read but Never Write: READ Solves Adapter Fusion Interference
本研究提出 READ 方法,透過「唯讀不寫」的單向耦合與標準化轉換,解決多個 LoRA 配接器融合時的參數干擾問題,在不增加推論成本的情況下完美保留舊技能並融入新技能。
Overcoming Context Drift: Trust Guided Decision Transformer Uses Prediction Error and Conformal Prediction for Robust Offline RL
本研究提出 TGDT 架構,藉由監控決策 Transformer 自身的狀態預測誤差,並結合分割共形預測與評論家機制,篩選出安全可信的上下文,有效解決長期決策任務中的效能衰退問題。
Weight Pair Encoding (WeightPE): Inducing a Smaller Grammar in Neural Network Weights
本研究提出 WeightPE,首度將「語法大小」作為訓練目標,利用直通估計器與有損 Re-Pair 壓縮,將權重最佳化為緊湊且可重複利用的階層式變長語法結構。