arXiv大型語言模型
基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens
最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。
2 分鐘閱讀
#pre-training
1 篇文章
Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens
最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。