
AI 摘要
- Google 推出 740M 參數的 EmbeddingGemma 2 多模態嵌入模型。
- 模型支援在手機與筆電端直接以文字搜尋圖片、影片及音訊資料。
- 採開源 Apache 2.0 授權,已於 Hugging Face 與 Kaggle 開放下載。
Google 正式發表新一代開源嵌入模型 EmbeddingGemma 2。該模型具備 7.4 億(740M)參數規模,支援文字、程式碼、圖片、影片與音訊等多模態資料處理,主打可直接部署於智慧型手機、筆記型電腦等邊緣裝置,實現完全不依賴雲端伺服器的本機端多模態語意檢索。
支援跨模態檢索與模組化載入架構
嵌入模型(Embedding Model)的核心功能是將文字、影像或聲音等非結構化資訊轉化為高維度數值向量。當資料語意相近時,其向量距離亦會接近,進而支援跨模態語意搜尋。舉例而言,使用者輸入「狗在草地追球」的文字敘述,系統無須依賴影片預先標註的文字標籤,即可透過畫面特徵找出對應的影片片段,甚至能以一段音訊尋找內容相近的影音檔案。
相較於第一代 EmbeddingGemma 僅專注於文字處理,EmbeddingGemma 2 擴展至視覺與音訊範疇。為兼顧效能與記憶體開銷,模型採用分開載入的架構設計:
- 純文字與程式碼模式:僅需載入 270M 參數的文字子模型,不必調用視覺與音訊模組。
- 完整多模態模式:載入完整的 740M 參數架構,支援全方位跨模態運算。
根據 Google 在 Pixel 11 Pro 上的量化版本測試數據,僅載入文字模型時約佔用 191MB 活動記憶體,而完整多模態模型運作時則約需 567MB,適合資源受限的手機等行動設備。
擴展至 8K 詞元容量與彈性向量維度
EmbeddingGemma 2 將單次處理的內容長度由前一代的 2K 詞元提升至 8K 詞元。在單一資料類型處理的情境下,該容量上限約可涵蓋:
- 最長約 5.5 分鐘的音訊
- 最多 29 張圖片
- 最多 58 個影片畫面幀
開發者亦可混合輸入文字、圖片、影片與音訊,但各類型資料將共同消耗同一個 8K 詞元的配額限制。
在輸出端,模型預設產生 768 維的嵌入向量。為降低本地端搜尋資料庫所佔用的儲存空間,開發者可彈性將輸出維度縮減至 512、256 或 128 維。Google 官方數據顯示,維度縮減至 256 維時仍能維持大致相當的檢索品質,而 128 維則較適用於輕量純文字索引情境。
程式碼檢索能力提升與開源部署管道
除了多模態能力外,EmbeddingGemma 2 亦顯著強化了程式碼理解能力。在 MTEB Code 程式碼嵌入評測基準中,其測試成績由第一代的 68.76 分提升至 78.68 分,可支援開發者於本機程式庫中搜尋功能相近的程式碼段落,或提供 AI 程式開發代理(Coding Agents)取得相關上下文參考。至於多語言文字檢索能力,則大致維持前代水準。
EmbeddingGemma 2 架構建立於 Gemma 4 之上,採用 Apache 2.0 開源授權協議。目前模型已於 Hugging Face 與 Kaggle 平臺開放下載。為協助開發者加速部署,Google 同步提供 MediaPipe 及 LiteRT 等輕量化工具,支援在行動裝置、瀏覽器環境及個人電腦上直接執行推論。
Reference Link : ithome.com.tw




