Google DeepMind 發表 Gemini 3.8 Live with Live Avatar:具備即時視覺化身與背景任務處理能力的企業級 AI 代理
Google DeepMind Introduces Gemini 3.8 Live with Live Avatar: Real-Time Visual AI Agents for Enterprise

繼推出 Gemini 3.8 Live 後,Google DeepMind 進一步發表 Live Avatar 功能,為其原生即時對話模型賦予視覺形象。該技術能同步處理視覺與語音輸入,呈現自然的表情、精準的對嘴與流暢的對話。更重要的是,它支援「非同步工具呼叫」,能一邊與使用者維持流暢對話,一邊在背景執行複雜任務(如飯店登記入住與資料查詢)。此外,該功能支援多達 97 種語言的無縫切換,並自動內建 SynthID 浮水印以確保內容可追溯性。
核心重點
即時多模態互動化身
結合語音與視訊生成,具備高精確度的對嘴與自然表情,提供像真人般流暢的對話輪替體驗。
非同步工具呼叫
AI 代理能在維持對話不中斷的同時,於背景觸發外部工具並讀取資料,實現「邊說邊做」的多工能力。
支援 97 種語言無縫切換
具備原生多國語言同步能力,可在對話中即時切換語言,並自動調整嘴型與表情,不損及影片畫質。
SynthID 安全防偽機制
在生成的音訊與影片中直接織入肉眼與聽覺無法察覺的 SynthID 浮水印,防止不實資訊的傳播。
技術圖解
為什麼重要
傳統虛擬助理常因「無法同時處理任務與說話」而顯得僵硬。Gemini 3.8 Live Avatar 透過非同步工具呼叫解決了這個痛點,讓 AI 能在與用戶聊天的同時,在背景完成查資料、訂房等繁瑣工作。這大幅提升了虛擬客服與數位分身的實用價值,標誌著 AI 代理正從「語音對話」邁向具備完整人設與實體辦事能力的「視覺化代理」。
對誰有影響
- 企業決策者
- AI 開發者
- 產品經理
可以怎麼使用
- 1智慧前台與客戶服務:例如在飯店櫃檯接待旅客,在閒聊的同時於背景完成登記入住手續。
- 2品牌專屬虛擬代言人:開發者可上傳單張高品質參考圖片,快速生成符合品牌形象的動態互動化身。
限制與注意事項
- 自訂化身功能(透過參考圖片生成)目前僅限通過企業白名單(Allowlist)的用戶申請使用。
- 即時高解析度影音生成與同步對頻寬要求極高,在網路不佳的環境下可能面臨畫面延遲或音畫不同步。
延伸閱讀
突破中心化瓶頸!Agensh 框架將多 Agent 協作無縫擴展至 1,024 個智慧體
Agensh: Scaling Multi-Agent Collaboration to 1,024 Agents Without a Central Orchestrator
Agensh 是一個無中心協調器的自組織多 Agent 框架,透過共享工作空間與非同步協作循環,成功將 Agent 協作規模擴展至 1,024 個,在複雜程式設計任務中展現顯著的效能擴展性。
別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent
Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis
Growing Harness 是一種新型的 Agent 訓練範式,它不依賴大模型在 context 中重複進行控制決策,而是透過失敗導向的程式碼生成與修復,將重複的控制邏輯固化為可執行的程式碼框架,使 4B 小模型也能發揮媲美大模型的效果,並降低高達 98% 的推論成本。