Aivora

Aivora全球 AI 專業知識,一次看懂

最新研究

Latest Research

CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術
arXivAI 程式開發

CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術

CliffCompaction: Cost-Efficient Context Compaction for Long-Horizon Coding Agents

CliffCompaction 是一種專為長任務程式碼 Agent 設計的自動壓縮技術,透過「僅刪減、不重寫」的策略與單次壓縮機制,在降低高達 50% token 成本的同時,顯著提升長對話與測試時擴展的效率。

2 分鐘閱讀
別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent
arXivAI 代理

別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent

Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis

Growing Harness 是一種新型的 Agent 訓練範式,它不依賴大模型在 context 中重複進行控制決策,而是透過失敗導向的程式碼生成與修復,將重複的控制邏輯固化為可執行的程式碼框架,使 4B 小模型也能發揮媲美大模型的效果,並降低高達 98% 的推論成本。

2 分鐘閱讀
類型安全不等於無誤:約束決策模型偏向選項字面名稱而非綁定規則
arXiv大型語言模型

類型安全不等於無誤:約束決策模型偏向選項字面名稱而非綁定規則

Type-Safe Is Not Error-Free: Constrained Decision Heads Follow Option Names, Not Their Rubrics

研究指出,限制輸出格式的「類型安全」決策模型,其決策極易受選項名稱字面語意(如 yes/no)的誤導,進而忽略實際綁定的評判規則,導致決策準確度劇烈下滑甚至完全相反。

2 分鐘閱讀
硬體驗證 AI 的試金石:EquivSVA 形式驗證資料集,揪出 LLM 程式碼生成的虛實
arXivAI 研究

硬體驗證 AI 的試金石:EquivSVA 形式驗證資料集,揪出 LLM 程式碼生成的虛實

Testing AI Hardware Verification: EquivSVA Dataset Reveals LLM Robustness Across Equivalent RTLs

EquivSVA 是一個開源且經過形式驗證的資料集,專為評估 LLM 生成 SystemVerilog 斷言(SVA)的穩健性而設計。它透過 120 個「行為家族」和 480 個等價但結構不同的 RTL 實作,測試 AI 是否能抓到本質行為,而非流於特定程式碼細節。

2 分鐘閱讀
AI 真的能幫產品設計省時間嗎?首個 Figma Make 的隨機對照實驗揭密
arXivAI 研究

AI 真的能幫產品設計省時間嗎?首個 Figma Make 的隨機對照實驗揭密

Does AI Save Time on Product Design? A Randomized Controlled Trial of Figma Make Workflows

這項針對 100 名專業人士的隨機對照實驗顯示,使用 AI 的 Prompt-to-Design 工具(如 Figma Make)可縮短約 20% 的任務完成時間,且對非設計專業的產品經理(PM)效果尤為顯著。

2 分鐘閱讀

大型語言模型

LLM

查看全部
類型安全不等於無誤:約束決策模型偏向選項字面名稱而非綁定規則
arXiv大型語言模型

類型安全不等於無誤:約束決策模型偏向選項字面名稱而非綁定規則

Type-Safe Is Not Error-Free: Constrained Decision Heads Follow Option Names, Not Their Rubrics

研究指出,限制輸出格式的「類型安全」決策模型,其決策極易受選項名稱字面語意(如 yes/no)的誤導,進而忽略實際綁定的評判規則,導致決策準確度劇烈下滑甚至完全相反。

2 分鐘閱讀

AI 代理

AI Agent

查看全部
別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent
arXivAI 代理

別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent

Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis

Growing Harness 是一種新型的 Agent 訓練範式,它不依賴大模型在 context 中重複進行控制決策,而是透過失敗導向的程式碼生成與修復,將重複的控制邏輯固化為可執行的程式碼框架,使 4B 小模型也能發揮媲美大模型的效果,並降低高達 98% 的推論成本。

2 分鐘閱讀

AI 程式開發

AI Coding

查看全部
CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術
arXivAI 程式開發

CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術

CliffCompaction: Cost-Efficient Context Compaction for Long-Horizon Coding Agents

CliffCompaction 是一種專為長任務程式碼 Agent 設計的自動壓縮技術,透過「僅刪減、不重寫」的策略與單次壓縮機制,在降低高達 50% token 成本的同時,顯著提升長對話與測試時擴展的效率。

2 分鐘閱讀

AI 研究

AI Research

查看全部
硬體驗證 AI 的試金石:EquivSVA 形式驗證資料集,揪出 LLM 程式碼生成的虛實
arXivAI 研究

硬體驗證 AI 的試金石:EquivSVA 形式驗證資料集,揪出 LLM 程式碼生成的虛實

Testing AI Hardware Verification: EquivSVA Dataset Reveals LLM Robustness Across Equivalent RTLs

EquivSVA 是一個開源且經過形式驗證的資料集,專為評估 LLM 生成 SystemVerilog 斷言(SVA)的穩健性而設計。它透過 120 個「行為家族」和 480 個等價但結構不同的 RTL 實作,測試 AI 是否能抓到本質行為,而非流於特定程式碼細節。

2 分鐘閱讀
AI 真的能幫產品設計省時間嗎?首個 Figma Make 的隨機對照實驗揭密
arXivAI 研究

AI 真的能幫產品設計省時間嗎?首個 Figma Make 的隨機對照實驗揭密

Does AI Save Time on Product Design? A Randomized Controlled Trial of Figma Make Workflows

這項針對 100 名專業人士的隨機對照實驗顯示,使用 AI 的 Prompt-to-Design 工具(如 Figma Make)可縮短約 20% 的任務完成時間,且對非設計專業的產品經理(PM)效果尤為顯著。

2 分鐘閱讀

AI 安全

AI Safety

查看全部