Aivora
arXiv大型語言模型進階

基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力

Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens

2 分鐘閱讀
基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
30 秒看懂

本研究發現,基礎語言模型內置了強大的推理能力,只需透過特定的開頭 token 提示(如 ".\n\nOkay" 或 "Alright,")即可被喚醒。例如,加上開頭提示後,Olmo-3-7B 的數學表現從 42% 飆升至 78%。研究團隊證實,強化學習(RL)本質上是提高了這些高質量開頭 token 的生成機率,而非憑空創造推理能力。此外,團隊透過因果資料干預,成功將「chicken」或「Think duck duck goose」等無厘頭字眼訓練成具備「一步步思考」效果的推理觸發詞。

核心重點

01

開頭 Token 喚醒推理

強制基礎模型以特定的 token 開頭,能使其在數學與程式任務上的表現逼近經過 RL 微調的同類模型。

02

重新理解 RL 的作用

強化學習的主要作用是提高這些高質量開頭 token 的出現機率,而非重新編寫或教導模型如何推理。

03

因果資料干預

研究團隊藉由操縱訓練資料,成功將任意詞彙(如 chicken)轉化為強大的推理觸發詞。

04

關聯訓練資料來源

不同的開頭 token 會在模型內部激發不同的隱藏狀態,這些狀態與訓練資料中的特定文件類型高度相關。

為什麼重要

這項研究顛覆了我們對大語言模型「推理能力」如何形成的認知。它表明推理能力並非完全由複雜的 RL 演算法注入,而是早已存在於基礎模型的預訓練資料中。藉由深入理解 token 觸發機制,開發者可以直接引導基礎模型表現,降低對昂貴 RL 訓練的依賴,並為模型對齊、安全控制(例如藉由開頭引導拒絕或合規)開闢了更輕量的新路徑。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1基礎模型零樣本推理引導:免去昂貴的 RL 微調,直接利用開頭 token 提升基礎模型的數學與程式表現。
  2. 2輕量化安全與對齊控制:藉由特定的 token 引導,控制模型展現拒絕或合規行為。

限制與注意事項

  • 需要手動尋找或測試特定模型最有效的開頭 token(例如 Olmo 適合 Okay,Qwen 適合 Alright)。
  • 本研究主要在數學、程式與安全合規等特定任務上驗證,尚不確定是否適用於所有通用複雜任務。

延伸閱讀