AI Daily ·
突破訓練與生成極限:多模態自我修復、彈性語言模型與高效視覺生成新進展
Today’s AI Highlights
今天的AI前沿研究聚焦於模型效率與生成品質的重大突破。首先,Telescopic Language Models (TLM) 實現了單次訓練即可適應多種計算預算的彈性架構;在視覺與多模態領域,UMM-Reflection 透過強化學習讓模型具備原生圖像自我修復能力,而 MGFlow 與 PDMD 則大幅提升了視覺與影片生成的效率與品質。此外,NstAgent 也成功將長篇故事生成規模擴展至10萬字。
- 01arXiv大型語言模型
伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
當前要滿足不同的推論運算預算,通常需要針對各個尺寸單獨訓練或壓縮模型。現有的「套娃語言模型(MLMS)」僅能提供少數固定的出口,若在非預設層退出則會導致效能崩潰。TLM 透過在訓練時隨機對容量軸進行前綴截斷監督(stochastic prefix supervision),並結合完整容量的錨點(full anchor),使模型在所有 20 個層級前綴上皆具備優秀的語言生成能力。在 200M 模型與 20B FineWeb-Edu 標記(tokens)的測試中,TLM 在不損失完整容量效能的前提下,將品質-預算曲線下面積降低了 43-44%,同時降低了 12% 的 GPU 訓練成本。
- 02arXivAI 研究
讓多模態模型自我修正!UMM-Reflection 透過交錯強化學習實現原生圖像生成反思
統一多模態模型(UMM)兼具視覺理解與圖像渲染能力,理論上能進行「診斷-修改-再診斷」的自我修正循環。然而,過去的方法(如 SFT)難以有效學習整個修正軌跡。本論文提出 UMM-Reflection,在單一模型內對完整的反思軌跡進行強化學習(RL)。利用共享初始圖像的「兄弟軌跡」進行群體相對優勢比較,並以單一軌跡級優勢同時更新反思 token 與流程化修正,避免複雜的每輪信用分配。實驗顯示,在 BAGEL 基準上其 GenEval 分數比 SFT 提升 12.05 分,且具備優秀的跨任務遷移能力。
- 03arXiv影像 AI
統一分佈訓練框架 MGFlow:實現高品質單步視覺生成
單步視覺生成能極大地提高影像生成速度,但其訓練一直缺乏統一的理論指導。本研究提出一個全新的理論框架,利用 Wasserstein 梯度流將全局分佈目標與點對點特徵更新連結。在此框架下,研究團隊開發了 MGFlow,以可調整粒度的混合高斯建模特徵分佈,並引入質量約束樣本分配與配對元件更新來解決模式崩潰。實驗顯示,MGFlow 在 ImageNet 上取得領先成績,並成功將 4B 參數的 FLUX.2 蒸餾為單步生成器,表現超越原版四步模型。
- 04arXivAI 研究
FurE:免用動物毛髮資料集,實現 10 倍加速的 3D 動物毛髮重建技術
重建逼真且可編輯的動物毛髮向來極具挑戰,主要受限於自遮擋、複雜細節以及缺乏動物毛髮資料集。由約翰霍普金斯大學等團隊提出的 FurE,透過優化根部約束潛在欄位並結合人類頭髮訓練的 PCA 解碼器,成功繞過資料稀缺難題。此外,它利用表面約束的高斯糖霜(Gaussian Frosting)與局部厚度提示來重建去毛後的動物軀體。實驗證明,FurE 不僅能泛化至真實與合成場景,更比現有最先進技術(SOTA)快上 10 倍。
- 05arXiv影片 AI
PDMD:投影分佈匹配蒸餾技術,解決影片擴散模型的一步生成偽影
影片擴散模型通常需要數十次去噪步驟,極耗計算資源。「分佈匹配蒸餾 (DMD)」能將步驟縮減至僅 4 步(NFE),但訓練過程中因「評論家 (critic)」誤差累積,容易導致影片過飽和與產生異常紋理。本研究提出 PDMD(投影分佈匹配蒸餾),透過將 DMD 的更新向量投影至特定幾何方向,在不丟失理想訊號的前提下過濾掉評論家誤差。此方法極其簡單(僅需修改一行程式碼,不增加額外模型或損失函數),並在 Wan2.1 和 MiniMax-H3 影音生成模型上取得領先的 VBench 與 VideoGen-Eval 評估成績。
- 06arXivAI 代理
TokenCast:精準預測 LLM Agent 執行過程中的 Token 消耗量
LLM Agent 在執行相同任務時,因動態的工具回饋與不斷累積的脈絡(context),不同執行次數的 Token 消耗可能相差達一個數量級。TokenCast 為每個執行片段建立可組合的成本表示法,同時記錄自身消耗與引入的脈絡增長。隨著執行展開,它能利用新觀察到的特徵即時更新預測。在實測中,TokenCast 平均降低了 14.5% 的預測誤差,並在預算控制模擬中成功節省了 21.3% 的 Token 消耗。
- 07arXivAI 研究
如何循環混合專家模型?全新 Foil 架構實現專家扁平化與注意力機制解耦
循環 Transformer 重複使用層區塊以提升參數利用率,而 MoE 模型則限制每個 token 的計算開銷。本文提出 Foil 架構,在保持專家參數與計算量不變的前提下解決了兩者結合的難題。Foil 包含兩大核心設計:第一是「扁平化專家」,將專家層數減半、單層專家數加倍,並將循環次數加倍,擴大路由選擇範圍;第二是「解耦注意力」,讓每次循環擁有獨立的注意力參數,而專家與路由器共享。在 100B token 預訓練實驗中,Foil 顯著降低了預訓練損失值,且下游任務表現優異。
- 08arXivAI 代理
以敘事狀態追蹤突破長篇小說生成:免微調的 NstAgent 框架
雖然大語言模型在創意寫作上表現出色,但撰寫長篇小說時常因無法維持敘事連貫性而受限。現有故事生成方法多侷限於一萬字以內。為了解決此問題,研究團隊開發了「敘事狀態追蹤代理」(NstAgent)。這是一個免微調的框架,能結構化地記錄角色設定、已發生情節與後續寫作大綱。實驗表明,NstAgent 成功將生成規模擴展至 10 萬字,且故事的連貫性與寫作品質並未隨著字數增加而衰退。