AI Daily ·
AI 前沿突破:AlphaGenome 繪製基因地圖與 Meta 推出 Muse 影音生成工具
Today’s AI Highlights
今天的 AI 焦點聚焦於科學與媒體生成的重大突破。Google DeepMind 攜手學術界推出 AlphaGenome Atlas,繪製人類基因組所有可能 DNA 變化的預測地圖;Meta 則發表 Muse Image 與預告 Muse Video,透過智慧代理工具與運算規模化推進媒體生成技術。此外,多項研究亦在擴展多代理協作、降低長文本推論成本及安全性挑戰上取得新進展。
- 01Google DeepMindAI 研究
Google DeepMind 推出 AlphaGenome Atlas:人類基因組所有 DNA 單一字母變異之預測圖譜
Google DeepMind 聯手哈佛大學、博德研究所、波士頓兒童醫院及埃克塞特大學等機構,共同發表了「AlphaGenome Atlas」。這項重大研究成功繪製出人類基因組中所有可能 DNA 單一字母變異的預測圖譜,為遺傳醫學與基因科學家提供了前所未有的全面性預測工具,有助於加速基因變異與疾病關聯性的研究。
02Meta AI影像 AIMeta 發表 Muse Image 與 Muse Video:首款導入 Agentic 機制與推理期算力擴展的媒體生成模型
Meta 超級智能實驗室發表 Muse 系列。Muse Image 不僅是影像生成器,更能像 Agent 一樣運作:它能在推理時進行自我修正,並調用「程式編寫」(繪製精確圖表與 QR code)與「搜尋」工具來確保事實準確。透過擴展推理期算力(結合文字與視覺 Token),其生成品質呈對數線性成長。目前 Muse Image 在 Arena 排行榜位居第二,而具備原生音訊支援的 Muse Video 則位居第三。
- 03arXiv大型語言模型
Flash-dLLM:為擴散大語言模型打造的 I/O 感知 KV 快取與平行解碼加速框架
擴散大語言模型(dLLM)能進行非自迴歸文字生成,但因缺乏高效的 KV 快取與平行解碼,其推論面臨嚴重的 GPU 記憶體 I/O 瓶頸。Flash-dLLM 針對此問題,設計了融合的 I/O 感知 KV 快取核心以減少冗餘資料移動。同時,它提出由 KV 快取驅動的「草稿與驗證」解碼策略,讓 dLLM 自身兼任草稿與驗證角色,無需額外輔助模型。實驗顯示,在 GSM8K 與 HumanEval 基準測試中,其推論速度比先前最強的 Elastic-Cache 分別提升了 5.1 倍與 11.0 倍,且完全不影響生成品質。
- 04arXivAI 代理
突破中心化瓶頸!Agensh 框架將多 Agent 協作無縫擴展至 1,024 個智慧體
傳統多 Agent 系統常因「中央協調器」的分配與協調能力而面臨擴展瓶頸。微軟等研究團隊推出 Agensh 框架,移除了中央協調器,改由 Agent 自行執行「獲取上下文、自主認領任務、執行並共享成果、驗證與合併進度」的非同步自組織循環。在 GPT-5.6-sol (high) 的支援下,Agensh 在 ProgramBench 與 pandoc 任務中,成功將 Agent 數量擴展至 1,024 個,大幅提升了測試通過率,驗證了「Agent 數量」可作為提升通用智慧的新擴展維度。
- 05arXivAI 程式開發
CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術
隨著程式碼 Agent 面臨百萬 token 的複雜任務,上下文視窗限制與高昂成本成為瓶頸。CliffCompaction 提出一種創新的自動壓縮技術:它「只刪減、不重寫」原始內容,且「絕不重複壓縮已壓縮的內容」(每次都從原始內容重新壓縮並丟棄舊壓縮)。這項技術成功降低了 50% 的成本,並在 Terminal-Bench 與 KernelBench 上達到頂尖性能,在平行測試時擴展(test-time scaling)下,以更低成本讓中階模型展現出媲美旗艦模型的實力。
- 06arXivAI 程式開發
SWE-Serve:首個針對「生產級推論服務」的 AI Agent 軟體工程基準測試
現有的軟體工程基準測試鮮少關注推論服務(Inference Serving)的複雜需求。SWE-Serve 填補了這一空白,基於熱門開源框架 SGLang 的真實變更,設計了 53 個涵蓋模型支援、執行期與 API 等面向的系統級任務。測試結果顯示,雖然最強的模型配置能達到 75% 的平均 pass@1,但在面對端到端(E2E)生產級測試時,有近三分之一在本地通過功能測試的提交會被拒絕。這揭示了本地碼農工作與真正達到生產環境正確性之間的巨大鴻溝。
- 07arXivAI 安全
破解 MCP 生態系:新型 A2M 攻擊框架揭示 AI Agent 的語意供應鏈安全威脅
隨著 Model Context Protocol (MCP) 被廣泛採用,AI Agent 開始頻繁與第三方伺服器工具互動。然而,MCP 主要依賴「語意比對」來選擇工具,這為攻擊者留下了新型供應鏈漏洞。研究人員開發出 A2M (Attraction-to-Manipulation) 黑箱框架,分為兩階段:第一階段優化惡意工具的描述資訊(Metadata)以提高被 Agent 呼叫的機率;第二階段則分析執行軌跡以動態調校回傳內容,進而操縱 Agent 的後續決策,甚至引發認知阻斷服務(Cognitive DoS)。
- 08arXivAI 代理
別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent
傳統的 LLM Agent 在處理連續任務時,常需要在 Context 中重複推理控制邏輯,耗費大量 Token。Growing Harness 顛覆此做法,從不含任何控制邏輯的「無策略鷹架」出發。在任務執行失敗時,系統利用軌跡定位問題、進行多失敗聯合修復,並以驗證閘道回滾會導致能力退化的程式碼。此過程不斷將控制邏輯累積固化為共享的程式碼框架(Harness)。實驗顯示,該方法成功讓 4B 小模型在網頁任務上達到 45% 的成功率(傳統工具調用僅 6.7%),同時減少了 76.0-91.8% 的 LLM 呼叫。
- 09arXivAI 研究
「誰對誰說了什麼?」SpeakerMem-R1 打造多方對話專屬的雙軌記憶機制
在多人對話(Multi-party dialogue)場景中,現有的 LLM 記憶系統常因發言交錯而混淆「誰說了什麼」或「這與誰有關」。為了解決這個痛點,研究團隊提出 SpeakerMem-R1。它採用「雙軌記憶」架構,同時儲存標記說話者的原始逐字訊息,以及從個人和群組視角推導出的結構化狀態,並在查詢時動態整合。為了降低記憶建構時的歸屬錯誤,團隊使用 SpeakerLevenshtein 與說話者條件的 GRPO 強化學習來訓練 Writer-R1 模型,在多項記憶基準測試中達到 SOTA 表現。
- 10arXiv大型語言模型
類型安全不等於無誤:約束決策模型偏向選項字面名稱而非綁定規則
結構化輸出(類型安全)能保證格式符合 Schema,但無法確保模型正確理解選項。本研究測試 Jev 等模型在 1200 個工作流決策中的表現,發現僅將選項名稱從 0/1 改為 no/yes(而保留原評判規則),就會導致每百題改變 70.4 個答案,且 AUC 從 0.94 暴跌至 0.23。這顯示模型決策高度依賴「選項名稱」的字面語意,而非「規則文本」。相反地,改用中性或隨機字串作為選項名稱,反而能消除此偏誤並維持正常準確度。