Aivora
arXiv大型語言模型專業

層級連續擴散語言模型:結合離散 Token 與連續潛在軌跡的全新生成架構

Hierarchical Continuous Diffusion Language Models: Coupling Discrete Tokens with Continuous Latents

2 分鐘閱讀
層級連續擴散語言模型:結合離散 Token 與連續潛在軌跡的全新生成架構
30 秒看懂

傳統離散擴散模型在並行解碼時會因獨立採樣而破壞 Token 間的統計依賴;連續擴散模型則因缺乏與有效 Token 的連結而難以保證生成品質。為解決此瓶頸,研究團隊提出 HC-DLM(層級連續擴散語言模型)。HC-DLM 以連續潛在狀態作為唯一的持久生成狀態,並在每一步去噪中讀出離散 Token 作為下一步潛在更新的支撐。實驗顯示,HC-DLM 在數獨求解、倒數計時規劃與 LM1B 語言建模任務中,表現皆顯著優於傳統擴散模型基線。

核心重點

01

克服傳統擴散瓶頸

解決了離散擴散並行解碼時的 Token 獨立性問題,以及連續擴散缺乏早期 Token 約束的缺陷。

02

單一耦合的去噪過程

將離散 Token 生成與連續潛在軌跡融合在單一架構中,其訓練目標源自 Token 概度的變分下界。

03

潛在狀態引導機制

連續潛在狀態是唯一的持久生成狀態,每一步讀出的 Token 會反饋作為下一步潛在更新的支撐與約束。

04

基準測試表現優異

在數獨求解、數學規劃(Countdown)及語言建模(LM1B)任務中,在同等模型大小下皆超越了基線模型。

技術圖解

三種擴散語言模型架構對比
離散擴散 (Discrete Diffusion)連續擴散 (Continuous Diffusion)層級連續擴散 (HC-DLM)
生成狀態離散 Token 鏈 / Discrete token chain連續向量 / Continuous vectors持久連續潛在軌跡 / Persistent continuous latent trajectory
Token 統計依賴並行解碼時易破壞 / Severed during parallel decoding透過連續狀態保留 / Preserved via continuous state透過潛在狀態與反饋保留 / Preserved via latent and feedback
結構約束力強(直接在離散空間)/ Strong (direct discrete space)弱(直至解碼前無約束)/ Weak (no ties until final decoding)強(每步讀出並反饋支撐)/ Strong (readout & scaffold at each step)

為什麼重要

這項研究為非自迴歸語言生成奠定了新基礎。透過將連續潛在空間的靈活性與離散 Token 的結構約束相結合,HC-DLM 能夠在不需要自迴歸逐字解碼的情況下,解決需要全局約束與雙向推理的複雜邏輯任務(如數獨和規劃)。這對於追求高效、非自迴歸大語言模型設計的團隊具有極高的參考價值。

對誰有影響

  • AI 研究人員
  • AI 開發者

可以怎麼使用

  1. 1結構化邏輯與拼圖推理任務(例如數獨求解)
  2. 2複雜的數學與符號規劃(例如倒數計時遊戲)
  3. 3需要全局約束滿足與強大雙向上下文關聯的非自迴歸文本生成

限制與注意事項

  • 架構設計與變分下界優化過程相對複雜,相較於簡單的擴散模型,其實作與調參門檻較高。
  • 雖然在特定基準上表現卓越,但其在大規模開放域文本生成與超大規模參數量下的擴展性仍有待驗證。

延伸閱讀

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構
Hugging Face大型語言模型

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構

Introducing Olmo-core 3: Open, Scalable Training Infrastructure for Trillion-Parameter MoEs

Olmo-core 3 是專為兆級參數 Mixture-of-Experts (MoE) 模型打造的開源訓練框架,大幅提升吞吐量並解決分散式訓練中的通訊瓶頸。

2 分鐘閱讀
SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
arXiv大型語言模型

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability

本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。

2 分鐘閱讀