Flash-dLLM:為擴散大語言模型打造的 I/O 感知 KV 快取與平行解碼加速框架
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
Latest Research
Agensh: Scaling Multi-Agent Collaboration to 1,024 Agents Without a Central Orchestrator
Agensh 是一個無中心協調器的自組織多 Agent 框架,透過共享工作空間與非同步協作循環,成功將 Agent 協作規模擴展至 1,024 個,在複雜程式設計任務中展現顯著的效能擴展性。
Who Said What to Whom? SpeakerMem-R1 Introduces Dual-Track Memory for Multi-Party Dialogues
針對多人對話中複雜的角色關係與脈絡,SpeakerMem-R1 透過標記說話者的「雙軌記憶」與 GRPO 強化學習,大幅提升長文本對話中的訊息歸屬與關係追蹤能力。
CliffCompaction: Cost-Efficient Context Compaction for Long-Horizon Coding Agents
CliffCompaction 是一種專為長任務程式碼 Agent 設計的自動壓縮技術,透過「僅刪減、不重寫」的策略與單次壓縮機制,在降低高達 50% token 成本的同時,顯著提升長對話與測試時擴展的效率。
SWE-Serve: Benchmarking Agentic Engineering for Production Inference Serving
SWE-Serve 是一個新型基準測試,包含來自 SGLang 的 53 個真實任務,旨在評估 AI Agent 在複雜推論伺服器架構中的程式碼實作與「生產環境正確性」。
Hijacking MCP Agents: How A2M Exposes Semantic Supply-Chain Risks
這項研究提出名為 A2M 的雙階段黑箱攻擊框架,揭示了使用 Model Context Protocol (MCP) 的 AI Agent 面臨的語意供應鏈風險,並呼籲業界加強工具審查與隔離機制。
Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis
Growing Harness 是一種新型的 Agent 訓練範式,它不依賴大模型在 context 中重複進行控制決策,而是透過失敗導向的程式碼生成與修復,將重複的控制邏輯固化為可執行的程式碼框架,使 4B 小模型也能發揮媲美大模型的效果,並降低高達 98% 的推論成本。
Type-Safe Is Not Error-Free: Constrained Decision Heads Follow Option Names, Not Their Rubrics
研究指出,限制輸出格式的「類型安全」決策模型,其決策極易受選項名稱字面語意(如 yes/no)的誤導,進而忽略實際綁定的評判規則,導致決策準確度劇烈下滑甚至完全相反。
Testing AI Hardware Verification: EquivSVA Dataset Reveals LLM Robustness Across Equivalent RTLs
EquivSVA 是一個開源且經過形式驗證的資料集,專為評估 LLM 生成 SystemVerilog 斷言(SVA)的穩健性而設計。它透過 120 個「行為家族」和 480 個等價但結構不同的 RTL 實作,測試 AI 是否能抓到本質行為,而非流於特定程式碼細節。
Does AI Save Time on Product Design? A Randomized Controlled Trial of Figma Make Workflows
這項針對 100 名專業人士的隨機對照實驗顯示,使用 AI 的 Prompt-to-Design 工具(如 Figma Make)可縮短約 20% 的任務完成時間,且對非設計專業的產品經理(PM)效果尤為顯著。
LLM
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
Type-Safe Is Not Error-Free: Constrained Decision Heads Follow Option Names, Not Their Rubrics
研究指出,限制輸出格式的「類型安全」決策模型,其決策極易受選項名稱字面語意(如 yes/no)的誤導,進而忽略實際綁定的評判規則,導致決策準確度劇烈下滑甚至完全相反。
AI Agent
Agensh: Scaling Multi-Agent Collaboration to 1,024 Agents Without a Central Orchestrator
Agensh 是一個無中心協調器的自組織多 Agent 框架,透過共享工作空間與非同步協作循環,成功將 Agent 協作規模擴展至 1,024 個,在複雜程式設計任務中展現顯著的效能擴展性。
Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis
Growing Harness 是一種新型的 Agent 訓練範式,它不依賴大模型在 context 中重複進行控制決策,而是透過失敗導向的程式碼生成與修復,將重複的控制邏輯固化為可執行的程式碼框架,使 4B 小模型也能發揮媲美大模型的效果,並降低高達 98% 的推論成本。
AI Coding
CliffCompaction: Cost-Efficient Context Compaction for Long-Horizon Coding Agents
CliffCompaction 是一種專為長任務程式碼 Agent 設計的自動壓縮技術,透過「僅刪減、不重寫」的策略與單次壓縮機制,在降低高達 50% token 成本的同時,顯著提升長對話與測試時擴展的效率。
SWE-Serve: Benchmarking Agentic Engineering for Production Inference Serving
SWE-Serve 是一個新型基準測試,包含來自 SGLang 的 53 個真實任務,旨在評估 AI Agent 在複雜推論伺服器架構中的程式碼實作與「生產環境正確性」。
AI Research
Who Said What to Whom? SpeakerMem-R1 Introduces Dual-Track Memory for Multi-Party Dialogues
針對多人對話中複雜的角色關係與脈絡,SpeakerMem-R1 透過標記說話者的「雙軌記憶」與 GRPO 強化學習,大幅提升長文本對話中的訊息歸屬與關係追蹤能力。
Testing AI Hardware Verification: EquivSVA Dataset Reveals LLM Robustness Across Equivalent RTLs
EquivSVA 是一個開源且經過形式驗證的資料集,專為評估 LLM 生成 SystemVerilog 斷言(SVA)的穩健性而設計。它透過 120 個「行為家族」和 480 個等價但結構不同的 RTL 實作,測試 AI 是否能抓到本質行為,而非流於特定程式碼細節。
Does AI Save Time on Product Design? A Randomized Controlled Trial of Figma Make Workflows
這項針對 100 名專業人士的隨機對照實驗顯示,使用 AI 的 Prompt-to-Design 工具(如 Figma Make)可縮短約 20% 的任務完成時間,且對非設計專業的產品經理(PM)效果尤為顯著。
AI Safety
Hijacking MCP Agents: How A2M Exposes Semantic Supply-Chain Risks
這項研究提出名為 A2M 的雙階段黑箱攻擊框架,揭示了使用 Model Context Protocol (MCP) 的 AI Agent 面臨的語意供應鏈風險,並呼籲業界加強工具審查與隔離機制。