Aivora

AI Daily ·

Google 發表 Gemini 4 Argon 與腦機解碼重大突破

Today’s AI Highlights

今日 AI 要聞聚焦於 Google 推出具備百萬輸出 Token 與長效推理能力的前沿模型 Gemini 4 Argon;同時,研究人員成功修復非侵入式腦機解碼中的「時間捷徑」缺陷,大幅降低詞錯率。此外,SCAPO 演算法與多代理系統 Cogentic 也為大型語言模型的推理精確度與自動化數學證明帶來顯著突破。

  1. Google 發表新一代前沿模型 Gemini 4 Argon:具備 100 萬 Token 輸出與強大自主 Agent 推理能力
    01Google DeepMindAI 代理

    Google 發表新一代前沿模型 Gemini 4 Argon:具備 100 萬 Token 輸出與強大自主 Agent 推理能力

    Google DeepMind 發表了 Gemini 4 Argon,此模型目前已向特定網路安全防禦者開放。Argon 的最大突破在於將輸出 token 限制從 64K 大幅擴充至 100 萬,使其能在單次推理中自主執行數十萬步的複雜任務。Google 內部已將其用於 C/C++ 程式碼向 Rust 的大規模遷移(高達 80 萬行),並藉由優化資料中心記憶體節省了 300 TiB 以上的空間。模型在 DeepSWE v1.1 與 LVBench 等多項基準測試上取得了領先成績,同時配備了全新的思維鏈與行動對齊監控機制。

  2. SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
    02arXiv大型語言模型

    SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

    在可驗證獎勵的強化學習(RLVR)中,傳統的 GRPO 演算法會將相同的優勢值平均分配給回覆中的所有 Token,這容易錯誤強化與推理無關的提示特徵。為了改善此一缺點,研究團隊提出 SCAPO(半事實信用增強策略最佳化)。該方法藉由「半事實提示干預」(即改變無關問題答案的提示詞特徵)來測量 Token 的機率漂移,並在早期訓練中調降不穩定 Token 的信用權重。實驗證實,SCAPO 成功降低了模型對提示詞的敏感度,並在 Qwen3 基準模型上大幅提升了數學任務的準確度。

  3. 排除「時間捷徑」漏洞:非侵入式腦機介面解碼技術的新突破
    03arXivAI 研究

    排除「時間捷徑」漏洞:非侵入式腦機介面解碼技術的新突破

    2025 年一項著名的非侵入式腦機介面研究(d'Ascoli 等人),在不含任何腦訊號的「合成資料」上竟能達到 22.0% 的單字解碼準確度,幾乎與真實腦波資料(22.3%)無異。本研究發現,這是因為舊方法將句子中重疊的單字時間視窗進行聯合編碼,使模型能透過「時間差」直接猜出字詞長度(如 short vs. long)。為解決此問題,研究團隊推出 SimpleB2T,改為獨立編碼每個單字視窗,徹底排除時間捷徑,迫使模型解析真實腦波。在結合預訓練 LLM 與多次觀測聚合後,成功將非侵入式解碼的字錯率(WER)降至 36.6%。

  4. EvoDuet:搜尋與解題協同演化的雙層優化框架,突破 LLM 科學發現的知識瓶頸
    04arXivAI 研究

    EvoDuet:搜尋與解題協同演化的雙層優化框架,突破 LLM 科學發現的知識瓶頸

    在利用大語言模型(LLM)進行科學發現的演化搜尋中,缺乏外部即時知識常導致探索停滯。傳統方法單純加入搜尋工具,容易隨著解答變化而重複檢索相同頁面。EvoDuet 引入了「雙層優化」機制,在不調整模型參數的前提下協同演化解答與搜尋查詢。每個迭代中,透過「檢索閘門」讓 LLM 評估知識落差,並利用內圈精煉查詢與篩選網頁文檔、外圈平行生成並評估候選解答。實驗顯示,此方法將 Gemini-3.8-Flash 的發現得分由 61.3% 提升至 82.3%,但在 Qwen3.5-9B 等小模型上則未能見效。

  5. Cogentic:用於自動化定理證明發現的多 Agent 協調框架
    05arXivAI 研究

    Cogentic:用於自動化定理證明發現的多 Agent 協調框架

    單次生成(Single-shot)的 LLM 在面對需要長期推導、探索多個競爭猜想的複雜數學難題時往往力有未逮。為此,研究團隊開發了 Cogentic 框架。該框架由「協調器」調度多個獨立的「證明 Agent」往不同方向探索,並由多個專門的「驗證元件」進行對抗式審查。通過驗證的中間結果會寫入「持續性驗證帳本」中,供後續迭代推進。以 Gemini 為底座,Cogentic 已成功在線上學習、拍賣理論與機制設計領域發現了 5 項全新學術成果,並已獲領域專家獨立證實。

  6. 融合循環與稀疏架構:Looped MoE 的全新縮放定律
    06arXiv大型語言模型

    融合循環與稀疏架構:Looped MoE 的全新縮放定律

    本研究提出「迴圈縮放定律(Loop Scaling Laws)」,首次將循環遞迴(recurrence)與 MoE 稀疏性共同納入縮放定律建模。循環遞迴能在不增加參數的情況下提升計算深度,而 MoE 則在不增加啟用算力的前提下擴充模型容量。實驗證實,MoE 帶來約 3 倍的啟用參數效率提升,循環架構則在推理任務上帶來約 2 倍的總參數效率。在兆級(trillion)Token 規模的訓練中,Looped MoE 在相同算力下能與兩倍大的無迴圈 MoE 性能匹敵,並支援測試時動態縮放。

  7. NVIDIA 推出 cuObject 與 SCADA 伺服器 SDK:實現免經 CPU 的 GPU 直連快取與物件儲存加速
    07NVIDIA DeveloperAI 硬體

    NVIDIA 推出 cuObject 與 SCADA 伺服器 SDK:實現免經 CPU 的 GPU 直連快取與物件儲存加速

    隨著 AI 模型與資料量暴增,傳統經由 CPU 複製資料的模式已成為效能瓶頸。NVIDIA 擴大開源組織 xio-sig,納入全新 cuObject 規範,並推出 SCADA 伺服器 SDK。這兩項技術讓 GPU 能直接透過 RDMA 與 DPU/NIC 技術,跨過 CPU 記憶體直接讀寫檔案與物件儲存(Object Storage)。IBM 已成功展示基於 SCADA 的儲存原型,而 Google Cloud 與 Microsoft 也計畫加入委員會,共同為高效能 AI 基礎設施建立統一的開放標準。

  8. 臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題
    08arXivAI 研究

    臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題

    在臨床診斷中,由於陽性樣本極稀少,傳統以準確度(Accuracy)為導向的提示詞優化容易因模型偏向預測多數陰性而失真。本文提出 Ranking-PE 框架,將優化機制重構為「成對排序(Pairwise Ordering)」。透過評估候選提示詞對「陽性-陰性」樣本對的排序正確性,使其優化目標直接對齊 AUROC。在 MIMIC 資料集上,此方法在不增加任何額外運算成本下,將 Qwen3-VL-8B 與 MedGemma-4B 的 AUROC 分別顯著提升了 5.8% 與 16.2%。

  9. ViTeX-Bench:解決影片場景文字編輯難題的首個高保真基準測試
    09arXiv影片 AI

    ViTeX-Bench:解決影片場景文字編輯難題的首個高保真基準測試

    現有的影片編輯模型在進行局部修改時,特別是針對招牌或商品標籤上的「場景文字」,往往面臨文字隨時間扭曲或破壞周圍背景的問題。為此,本研究推出 ViTeX-Bench 基準測試套件,包含由 387 個真實 720p 影片組成的資料集,以及涵蓋文字正確性、視覺品質與局部性等 3 大維度、共 13 項指標的評估協定。此外,團隊微調並釋出 14B 的參考編輯器模型,在多項指標上取得領先表現。

  10. 免 3D 結構與重構解碼器!VideoMSN 利用超大型圖片將影像分類器轉化為高效視訊學習器
    10arXivAI 研究

    免 3D 結構與重構解碼器!VideoMSN 利用超大型圖片將影像分類器轉化為高效視訊學習器

    本研究提出 VideoMSN 框架,旨在解決傳統視訊自我監督學習依賴重型 3D 架構或重構解碼器的痛點。VideoMSN 將視訊訊框排列成網格狀的「超大型圖片」(super images),並建立兩種視角:空間修補遮罩(spatial patch masking)與時間訊框遮罩(temporal frame masking)。透過共享的 ViT 編碼器(如 DINO-v3)與 Siamese 損失函數進行特徵對齊,無需解碼器重構即可高效擷取時空資訊。在 Kinetics-400 等數據集上達到 SOTA,且訓練期數最高縮減至 160 分之一。

過往日報