Aivora
arXivAI 研究專業

LIFT 架構:透過老師監督引入潛在資訊回饋,突破 Transformer 的單向限制

LIFT: Breaking Transformer Feed-Forward Bottlenecks with Latent Information Feedback

2 分鐘閱讀
LIFT 架構:透過老師監督引入潛在資訊回饋,突破 Transformer 的單向限制
30 秒看懂

傳統 Transformer 的資訊流是單向的,僅能靠解碼出的 token 作為跨步驟傳遞的唯一管道。LIFT(潛在資訊回饋 Transformer)打破了這個限制。在預訓練期間,它利用現成預訓練模型的下一 token 分佈,為每個輸入 token 標註一個高密度的「資訊狀態」。模型被訓練成能同時預測下一個 token 與下一個狀態。推理時,模型會將自己預測的狀態回饋至輸入。實驗證實,135M 至 1B 參數的 LIFT 模型在推理、程序性任務上表現皆優於傳統 Transformer。

核心重點

01

突破單向傳播限制

傳統 Transformer 無法將深層表示回傳至淺層,迫使模型重複計算中間結果。LIFT 則引入了深層到淺層的潛在狀態回饋機制。

02

老師監督的狀態學習

利用預先計算好的現成模型 token 分佈作為密集狀態,將循環狀態學習轉化為可平行化的「老師逼近」預測問題。

03

高效平行預訓練與低推理開銷

預訓練期間狀態已預先計算,因此仍保持完全平行化;推理時僅增加極小且隨模型規模增大而遞減的計算開銷。

04

卓越的狀態追蹤與資料效率

在狀態追蹤任務中,極小的 LIFT 模型表現優於使用 8 倍資料量訓練的同尺寸傳統 Transformer。

技術圖解

標準 Transformer 與 LIFT 比較
標準 TransformerLIFT
跨步驟資訊流僅透過解碼出的 TokenToken 搭配潛在狀態回饋
深層至淺層傳播無(僅前饋傳播)有,透過預測狀態回饋
預訓練平行化完全平行化完全平行化(利用預先計算的狀態)
狀態追蹤資料效率基準水準卓越(同效能僅需 1/8 資料量)

為什麼重要

此研究為 Transformer 架構注入了新型態的記憶與狀態傳遞機制。過往要讓模型具備循環狀態往往會破壞預訓練的並行性,而 LIFT 巧妙地透過「老師監督」解決了這個難題。這意謂著未來的 LLM 可以用更少的參數與 token 預算,實現更強的邏輯推理與長期狀態追蹤能力,大幅提升高效率模型部署的實用性。

對誰有影響

  • AI 開發者
  • AI 研究人員

可以怎麼使用

  1. 1程序性任務與複雜演算法執行
  2. 2需要長期狀態追蹤與多步驟邏輯推理的情境

限制與注意事項

  • 推理時會產生額外的微小計算開銷,雖然此開銷會隨模型規模增大而減少。
  • 預訓練階段需要依賴現成且效能良好的預訓練模型(老師模型)來預先計算狀態資料。

延伸閱讀

Imagine3D-LLM:讓多模態大模型在回答前「腦補」出 3D 場景
arXivAI 研究

Imagine3D-LLM:讓多模態大模型在回答前「腦補」出 3D 場景

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

受到人類空間推理的啟發,Imagine3D-LLM 讓多模態大模型在回答前,先將多視角影像重建為精簡的 3D 點雲與高斯潑濺(3DGS)表示法,顯著提升其 3D 理解與空間推理能力。

2 分鐘閱讀
區域去噪失效與語意分化的同步:生成模型中的「相變」理論研究
arXivAI 研究

區域去噪失效與語意分化的同步:生成模型中的「相變」理論研究

The Convergence of Local Denoising Breakdown and Semantic Speciation in Generative Models

本研究探討生成模型中「語意分化」(決定生成類別)與「非區域性」(區域去噪失效)高度同步的現象,證明語意資訊是連結兩者的共同因,並定義了系統規模擴大時的相變行為。

2 分鐘閱讀