基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens
本研究發現,基礎語言模型內置了強大的推理能力,只需透過特定的開頭 token 提示(如 ".\n\nOkay" 或 "Alright,")即可被喚醒。例如,加上開頭提示後,Olmo-3-7B 的數學表現從 42% 飆升至 78%。研究團隊證實,強化學習(RL)本質上是提高了這些高質量開頭 token 的生成機率,而非憑空創造推理能力。此外,團隊透過因果資料干預,成功將「chicken」或「Think duck duck goose」等無厘頭字眼訓練成具備「一步步思考」效果的推理觸發詞。
核心重點
開頭 Token 喚醒推理
強制基礎模型以特定的 token 開頭,能使其在數學與程式任務上的表現逼近經過 RL 微調的同類模型。
重新理解 RL 的作用
強化學習的主要作用是提高這些高質量開頭 token 的出現機率,而非重新編寫或教導模型如何推理。
因果資料干預
研究團隊藉由操縱訓練資料,成功將任意詞彙(如 chicken)轉化為強大的推理觸發詞。
關聯訓練資料來源
不同的開頭 token 會在模型內部激發不同的隱藏狀態,這些狀態與訓練資料中的特定文件類型高度相關。
為什麼重要
這項研究顛覆了我們對大語言模型「推理能力」如何形成的認知。它表明推理能力並非完全由複雜的 RL 演算法注入,而是早已存在於基礎模型的預訓練資料中。藉由深入理解 token 觸發機制,開發者可以直接引導基礎模型表現,降低對昂貴 RL 訓練的依賴,並為模型對齊、安全控制(例如藉由開頭引導拒絕或合規)開闢了更輕量的新路徑。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1基礎模型零樣本推理引導:免去昂貴的 RL 微調,直接利用開頭 token 提升基礎模型的數學與程式表現。
- 2輕量化安全與對齊控制:藉由特定的 token 引導,控制模型展現拒絕或合規行為。
限制與注意事項
- 需要手動尋找或測試特定模型最有效的開頭 token(例如 Olmo 適合 Okay,Qwen 適合 Alright)。
- 本研究主要在數學、程式與安全合規等特定任務上驗證,尚不確定是否適用於所有通用複雜任務。
延伸閱讀

解鎖阿聯酋方言與文化:專為在地語境打造的 Falcon-Emirati-7B 模型
Falcon-Emirati-7B: Bridging the Gap in Emirati Arabic Dialect and Culture
Falcon-Emirati-7B 是專為阿聯酋阿拉伯語設計的 7B 參數模型,克服了傳統 LLM 僅懂標準阿拉伯語的限制,精準掌握在地方言、詩歌與文化脈絡。
LESSER:僅用輸出層梯度,實現高達 9.7 倍加速的 LLM 訓練後資料篩選
LESSER: High-Efficiency Post-Training Data Selection Using Output-Layer Gradients
研究團隊推出 LESSER 框架,利用僅需前向傳播的「輸出層梯度」取代昂貴的全參數反向傳播,大幅降低 LLM 訓練後資料篩選的運算成本。
TACO 最佳化器:將 32B 大模型全參數微調帶入單張 GPU 的極簡幾何學
TACO Optimizer: Unleashing Full-Parameter 32B LLM Fine-Tuning on a Single GPU
TACO 是一款新型超低記憶體最佳化器,透過在權重矩陣每行中僅保留最大幅度的梯度符號,將最佳化器狀態記憶體縮減 174 倍,讓單張 GPU 即可微調 32B 模型。