Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力
Google Launches EmbeddingGemma 2: Compact 740M Parameter Multimodal Embedding Model for Ultra-Low Latency Edge AI

Google 推出開源多模態嵌入模型 EmbeddingGemma 2(740M 參數),能直接在裝置端將文字、圖片、影片畫格和音訊統一映射至單一向量空間,省去串接多個模型的延遲與記憶體開銷。在 Pixel 11 Pro 上,完整多模態模型僅需約 567MB RAM。透過全新最佳化的 LiteRT 與 MediaPipe,開發者可輕鬆在 Android、iOS 和 macOS 上實現「打字即搜尋」的離線媒體檢索與百毫秒內的零樣本意圖路由。
核心重點
統一的多模態向量空間
將文字、影像、影片及音訊融合成單一向量,無需在本地繁瑣地串接多個轉譯與語意模型。
極致輕量與低記憶體
僅 740M 參數,在 Pixel 11 Pro 上全模型運作僅需約 567MB RAM,純文字版僅需 191MB。
百毫秒內零樣本決策
不需微調即可直接作為意圖路由或動作預測引擎,在 500 個選項測試中每輪運算低於 100 毫秒。
跨平台部署與硬體加速
支援 LiteRT、MediaPipe Tasks 與 Android ML Kit,在 MacBook M5 Pro GPU 上處理影像嵌入僅需 37.3 毫秒。
技術圖解
為什麼重要
這項技術徹底改變了裝置端 AI 的實用性。傳統的多模態搜尋需要依賴雲端,或是在本地端吃力地串接語音轉文字、圖片描述和文字嵌入等多個模型。EmbeddingGemma 2 以極輕量的架構打破此壁壘,不僅保護使用者隱私,還能在完全離線的情況下進行毫秒級的影片片段檢索與多模態搜尋,為邊緣運算、離線助理及智慧硬體開啟全新可能。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
- 新創創辦人
可以怎麼使用
- 1裝置端媒體即時搜尋
- 2離線會議與文件助理
- 3即時意圖與動作路由
限制與注意事項
- 硬體效能與記憶體限制:在舊型或非旗艦裝置上,多模態完整模型(~567MB RAM)仍可能面臨記憶體壓力或缺乏 NPU 加速的問題。
- 複雜邏輯推理局限性:雖然零樣本決策速度極快,但對於高度複雜、多步驟的推理任務,其精準度仍不及雲端大型模型。
延伸閱讀

解鎖阿聯酋方言與文化:專為在地語境打造的 Falcon-Emirati-7B 模型
Falcon-Emirati-7B: Bridging the Gap in Emirati Arabic Dialect and Culture
Falcon-Emirati-7B 是專為阿聯酋阿拉伯語設計的 7B 參數模型,克服了傳統 LLM 僅懂標準阿拉伯語的限制,精準掌握在地方言、詩歌與文化脈絡。
基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens
最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。
循環語言模型的「定點」重塑:邁向高效訓練、解碼與強化學習的全新架構
Towards Looped Models Done Right: Rethinking at Fixed Points for Efficient Training, Decoding, and RL
本研究探討循環語言模型(Looped Models)在逼近定點時的特性,提出「學習深度先驗」與「正交輸入注入」機制,顯著降低 KV 快取並大幅提升訓練、解碼與強化學習效率。