Aivora

AI Daily ·

AI Daily:Queen西洋棋模型大師級登場,NVIDIA OpenShell與DLSS 5同步亮相

Today’s AI Highlights

今日AI焦點涵蓋多領域突破:4B參數的西洋棋語言模型Queen展現大師級實力(Elo 2697)並能流暢解說棋局;NVIDIA則推出OpenShell以強化AI代理的安全執行與沙盒隔離,同時發表導入3D引導神經渲染的DLSS 5。此外,EyeRobot 2.0實現了無須腕部相機的精準機器人雙手操作,為自動化與具身智能帶來全新進展。

  1. 減少解碼器反而增強編碼器:從新視角合成中提煉強大三維幾何表徵
    01arXivAI 研究

    減少解碼器反而增強編碼器:從新視角合成中提煉強大三維幾何表徵

    新視角合成(NVS)理論上能訓練模型理解 3D 結構,但現有編碼器學習到的幾何表徵往往不盡理想。本研究指出兩大核心病灶:一是「空間表達力過強的解碼器」代勞了幾何推導,使編碼器「偷懶」;二是「低階像素級重建目標」阻礙了高階特徵的學習。為此,團隊提出自監督架構 SNAP,採用限制其能力的「姿態條件局部解碼器」與「潛在空間重建目標」。實驗證明,SNAP 在視覺定位、深度估計、機器人操控等五大任務中表現優異,且在相機視角大幅偏移時仍展現極佳的韌性。

  2. EyeRobot 2.0:無需手腕相機,用「主動注視」實現精準雙手機器人操控
    02arXiv機器人

    EyeRobot 2.0:無需手腕相機,用「主動注視」實現精準雙手機器人操控

    傳統機器人依賴手腕相機來進行精準操作,但這會增加硬體成本且易受遮擋影響。EyeRobot 2.0 提出「主動視覺定位(AVF)」技術,透過旋轉雙目相機物理聚焦於 3D 凝視點,並在影像中心分配更多視覺 Token 進行仿黃斑部處理。系統透過分層強化學習訓練注視策略與目標選擇器,在 1000 多次實體測試中,不僅比傳統無手腕相機的系統高出 40% 成功率,更在相機受遮擋時大幅超越配有手腕相機的系統。

  3. 懂棋藝也會說人話:4B 參數模型 Queen 達到特級大師水準並能清晰解釋每步棋
    03arXivAI 研究

    懂棋藝也會說人話:4B 參數模型 Queen 達到特級大師水準並能清晰解釋每步棋

    傳統最強的西洋棋引擎下棋能力超群卻無法解釋原因,而一般大語言模型雖能言善道卻棋藝不佳。普林斯頓等機構的研究團隊開發了僅有 4B 參數的「Queen」模型。該模型透過交叉注意力機制,將「沉默的西洋棋編碼器」與指令微調後的語言模型融合。接著,利用一種類似「自然語言版貝爾曼更新」的迭代蒸餾演算法,在 7 次迭代中將模型 Elo 積分大幅提升超過 900 分(從 1782 升至 2697),不僅棋力達到特級大師水準,其策略解釋的流暢度與連貫性更逼近 GPT-5.6 等最頂級的模型。

  4. FrugalEvo:雙模型協作的成本感知型 LLM 程式最佳化演化框架
    04arXivAI 程式開發

    FrugalEvo:雙模型協作的成本感知型 LLM 程式最佳化演化框架

    傳統的 LLM 程式演化方法往往只專注於固定迭代次數下的效能,忽略了高昂的 API 呼叫成本。FrugalEvo 引入了成本感知機制,採用雙模型策略:由高成本的強大模型(如 GPT-5.6 Terra)負責高層次的策略探索,再由低成本的輕量模型(如 Luna)進行具體的程式碼實作與反覆迭代。同時,它透過優化提示詞結構來大幅提高 KV 快取重用率,並提出全新指標 BA-AUC 來衡量預算內的優化效率。在圓形裝箱等挑戰性任務中,它僅以 0.55 至 1.68 美元的極低成本,就達到或超越了過去平均需要約 50 美元的基準模型。

  5. Pivot-SD:針對遮罩擴散語言模型的高效自我蒸餾框架
    05arXivAI 研究

    Pivot-SD:針對遮罩擴散語言模型的高效自我蒸餾框架

    遮罩擴散語言模型(dLMs)在複雜推理中具備平行生成的潛力,但去噪過程中僅有少數關鍵決策(pivots)會決定最終的生成品質,傳統方法難以對此進行精準的「信用分配」。為了克服此難題,研究人員提出 Pivot-SD。該框架利用資訊增益指標,篩選出大幅降低剩餘遮罩不確定性的樞紐標記(pivots)。針對成功的軌跡,僅對其樞紐進行交叉熵微調;針對失敗軌跡,則僅對其樞紐進行目標非概似(targeted unlikelihood)訓練,其餘部分保持不變。在僅使用 200 個問題的極低數據成本下,成功提升了 LLaDA-8B-Instruct 在數學與程式基準測試中的表現。

  6. NVIDIA OpenShell:不重寫程式碼,為 AI Agent 部署執行階段安全隔離防護
    06NVIDIA DeveloperAI 安全

    NVIDIA OpenShell:不重寫程式碼,為 AI Agent 部署執行階段安全隔離防護

    隨著自主 AI Agent 權限擴大,誤刪生產資料或洩漏機密的風險也大幅增加。NVIDIA OpenShell 0.1.0 提供了一套位於 Agent 工作負載外部的安全執行階段。它由 Gateway、Supervisor 和 Sandbox 三大元件組成,能在作業系統核心層級限制檔案系統存取,並深度解析 HTTP、GraphQL 及 MCP 流量。此外,它能將真實憑證保留在沙盒外,並使用「形式化策略證明」確保 Agent 無法透過對抗性話術或提示詞來騙取非授權的權限。

  7. NVIDIA 發表 DLSS 5 與 3D 引導神經渲染:帶來 ACE 語音升級及 RTX Kit 幾何技術突破
    07NVIDIA DeveloperAI 硬體

    NVIDIA 發表 DLSS 5 與 3D 引導神經渲染:帶來 ACE 語音升級及 RTX Kit 幾何技術突破

    NVIDIA 發表 DLSS 5,透過全新的「3D 引導神經渲染」階段,以遊戲引擎原本的幾何與光源為基礎,在 GeForce RTX 50 系列顯示卡上實現高達 4K 的即時、穩定畫面強化,並已應用於《NBA 2K27》。同時,NVIDIA ACE 語音管線迎來 Nemotron Speech 3.5 與 Qwen3 TTS 等模型更新,RTX Mega Geometry 2.0 則為《Gears of War: E-Day》等新作提供連續細節層次(LOD)串流支援。

  8. 解鎖阿聯酋方言與文化:專為在地語境打造的 Falcon-Emirati-7B 模型
    08Hugging Face大型語言模型

    解鎖阿聯酋方言與文化:專為在地語境打造的 Falcon-Emirati-7B 模型

    阿聯酋阿拉伯語富含口語方言與文化隱喻(如 Nabati 詩歌),僅理解現代標準阿拉伯語(MSA)的通用模型常漏失其真實意圖。為了突破此瓶頸,團隊在 Falcon-H1(Mamba 與 Transformer 混合架構)基礎上,融合了真實論壇方言、文化歷史文獻,以及受嚴格字典限制的合成資料,打造出 Falcon-Emirati-7B。它在專屬測試基準「Alyah」上取得了 84.83% 的優異成績,且能真正以阿聯酋方言進行自然對話。

  9. 4DCodeBench:評估 AI Agent 動態場景 4D 反向圖形學與程式碼生成能力的全新基準
    09arXivAI 研究

    4DCodeBench:評估 AI Agent 動態場景 4D 反向圖形學與程式碼生成能力的全新基準

    4DCodeBench 挑戰 AI Agent 執行「4D 反向圖形學」。Agent 必須觀察動態影片(涵蓋形變、流體與碎裂等物理現象),並將其轉譯為緊湊的可執行繪圖程式碼。評估結果顯示,目前在靜態 3D 重建表現優異的前沿模型,在理解與重建複雜物理動態程式碼時仍面臨巨大挑戰。

  10. 世界模型該遺忘什麼?以「分層保留」實現持續適應環境的能力
    10arXivAI 研究

    世界模型該遺忘什麼?以「分層保留」實現持續適應環境的能力

    傳統的持續學習將「遺忘」視為失敗,但這不適用於環境會動態改變的世界模型(world models)。本研究提出「分層保留」架構,依時間尺度將知識分類:物理定律與物體恆存等「不變要素」必須永久保留,而特定的環境事實則需在變更時立即修正。現有指標無法區分正確的知識修正與災難性遺忘,因此研究團隊推出新評估指標「差異化保留」,同時衡量不變性測試與修正延遲。

過往日報