Aivora
Meta AI影像 AI進階

Meta 發表 Muse Image 與 Muse Video:首款導入 Agentic 機制與推理期算力擴展的媒體生成模型

Meta Introduces Muse Image and Muse Video: Advancing Media Generation with Agentic Tools and Compute Scaling

2 分鐘閱讀
Meta 發表 Muse Image 與 Muse Video:首款導入 Agentic 機制與推理期算力擴展的媒體生成模型
30 秒看懂

Meta 超級智能實驗室發表 Muse 系列。Muse Image 不僅是影像生成器,更能像 Agent 一樣運作:它能在推理時進行自我修正,並調用「程式編寫」(繪製精確圖表與 QR code)與「搜尋」工具來確保事實準確。透過擴展推理期算力(結合文字與視覺 Token),其生成品質呈對數線性成長。目前 Muse Image 在 Arena 排行榜位居第二,而具備原生音訊支援的 Muse Video 則位居第三。

核心重點

01

具備主動工具調用能力

整合程式編寫(生成精確圖表、QR code)與網頁搜尋,大幅提升影像的事實準確度與細節表現。

02

湧現自我修正機制

模型能在思維鏈(CoT)中審視自身草稿,自主決定進行局部修改或重新生成,此能力在強化學習中自然湧現。

03

推理期算力擴展

透過增加推理時的「思考」時間(結合文字推理與視覺生成 Token),圖像品質與人類偏好分數呈對數線性規模化成長。

04

多重參考圖像合成

支援在提示詞中混合多張參考圖片,能精確提取並融合人物、服裝、風格與環境等元素。

技術圖解

Muse Image Agentic 影像生成工作流
開始推理執行工具獲取事實回傳事實與渲染圖視覺 Token 生成檢驗影像品質不符預期,重新規劃通過評估,加上 Content Seal輸入提示詞與參考圖輸出最終影像與浮水印調用工具 (搜尋/程式碼)生成初始草稿思維鏈與規劃自我修正 (評估草稿)

為什麼重要

這代表多媒體生成正從單純的「提示詞到影像」映射,演進到「Agent 協作生成」。模型不再只是猜測使用者意圖,而是能主動查找資料、寫程式修正錯誤,並在畫出成品前不斷自我審查。這解決了過往 AI 繪圖難以精確控制、缺乏真實事實依據、以及無法多輪精細編輯的痛點,證明了大型語言模型的推理與算力擴展框架能成功套用到視覺生成上。

對誰有影響

  • AI 開發者
  • 內容創作者
  • 產品經理
  • 企業決策者

可以怎麼使用

  1. 1創建包含實用程式碼的動態 GIF、網頁或互動式視覺遊戲。
  2. 2結合多個產品與環境參考圖,為小企業快速生成高精準度的行銷素材。
  3. 3在 Instagram 等社群平台進行高連貫性的多輪、局部影像編輯與腦力激盪。

限制與注意事項

  • Muse Video 目前在影音同步以及符合物理定律的快速運動上仍有性能差距。
  • 雖然已推出檢測工具預覽,但 Content Seal 隱形水印在極端修改下的強韌性仍有待更廣泛的實證。