Aivora
Google AI Developers大型語言模型進階

Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力

Google Launches EmbeddingGemma 2: Compact 740M Parameter Multimodal Embedding Model for Ultra-Low Latency Edge AI

2 分鐘閱讀
Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力
30 秒看懂

Google 推出開源多模態嵌入模型 EmbeddingGemma 2(740M 參數),能直接在裝置端將文字、圖片、影片畫格和音訊統一映射至單一向量空間,省去串接多個模型的延遲與記憶體開銷。在 Pixel 11 Pro 上,完整多模態模型僅需約 567MB RAM。透過全新最佳化的 LiteRT 與 MediaPipe,開發者可輕鬆在 Android、iOS 和 macOS 上實現「打字即搜尋」的離線媒體檢索與百毫秒內的零樣本意圖路由。

核心重點

01

統一的多模態向量空間

將文字、影像、影片及音訊融合成單一向量,無需在本地繁瑣地串接多個轉譯與語意模型。

02

極致輕量與低記憶體

僅 740M 參數,在 Pixel 11 Pro 上全模型運作僅需約 567MB RAM,純文字版僅需 191MB。

03

百毫秒內零樣本決策

不需微調即可直接作為意圖路由或動作預測引擎,在 500 個選項測試中每輪運算低於 100 毫秒。

04

跨平台部署與硬體加速

支援 LiteRT、MediaPipe Tasks 與 Android ML Kit,在 MacBook M5 Pro GPU 上處理影像嵌入僅需 37.3 毫秒。

技術圖解

EmbeddingGemma 2 裝置端多模態檢索流程
預先建立索引儲存向量即時轉換比對輸出輸入查詢 (圖/文/音)本地媒體資料EmbeddingGemma 2SQLite 向量庫餘弦相似度比對即時檢索結果

為什麼重要

這項技術徹底改變了裝置端 AI 的實用性。傳統的多模態搜尋需要依賴雲端,或是在本地端吃力地串接語音轉文字、圖片描述和文字嵌入等多個模型。EmbeddingGemma 2 以極輕量的架構打破此壁壘,不僅保護使用者隱私,還能在完全離線的情況下進行毫秒級的影片片段檢索與多模態搜尋,為邊緣運算、離線助理及智慧硬體開啟全新可能。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理
  • 新創創辦人

可以怎麼使用

  1. 1裝置端媒體即時搜尋
  2. 2離線會議與文件助理
  3. 3即時意圖與動作路由

限制與注意事項

  • 硬體效能與記憶體限制:在舊型或非旗艦裝置上,多模態完整模型(~567MB RAM)仍可能面臨記憶體壓力或缺乏 NPU 加速的問題。
  • 複雜邏輯推理局限性:雖然零樣本決策速度極快,但對於高度複雜、多步驟的推理任務,其精準度仍不及雲端大型模型。

延伸閱讀

基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
arXiv大型語言模型

基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力

Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens

最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。

2 分鐘閱讀