←新聞 1 / 8→

開發工具

EmbeddingGemma 2:開發者指南

EmbeddingGemma 2: The Developer Guide

EmbeddingGemma 2:開發者指南

developers.googleblog.com · 2026-10-07

摘要

Google 推出 EmbeddingGemma 2,這是一款輕量級開源多模態嵌入模型,能將文字、程式碼、影像、影片和音訊映射至統一的 768 維向量空間。開發者可利用 sentence-transformers 庫加載不同參數量的模組化編碼器,並透過 Matryoshka 表示學習技術動態截斷向量維度,在維持高檢索效能的同時大幅降低向量資料庫的儲存需求。

Google 推出 EmbeddingGemma 2 多模態嵌入模型

Google 於 2026 年 10 月 6 日發布 EmbeddingGemma 2,這是一款以 Gemma 4 架構開發的輕量級開源模型,採用 Apache 2.0 授權條款。現代搜尋與檢索增強生成(RAG)應用常得同時處理技術文件、原始碼、影像、影片和音訊,這款模型就是針對這個問題而做。

模組化架構與參數量彈性

EmbeddingGemma 2 的核心特色是模組化的記憶體配置,開發者不必載入完整模型,可依需求選擇特定的編碼器。模型提供四種參數量配置:只處理文字與程式碼的 270M 版本、加入視覺處理的 440M 版本、加入音訊處理的 570M 版本,以及支援全多模態的 740M 版本。所有配置都投影到相同的相容向量空間,因此不同配置產生的嵌入結果可以直接比對。

技術實作上,文字與程式碼部分採用調整過的 Gemma 4 解碼器,支援 8,192 個 token 的上下文視窗。視覺編碼器額外增加 170M 參數,處理影像、視覺文件(如 PDF、簡報、圖表)及影片幀。音訊編碼器額外增加 300M 參數,可直接接收原始音訊輸入。若在裝置端 RAG 管線中與 Gemma 4 搭配使用,兩者共用相同的文字分詞器與音訊編碼器架構,能進一步減少整體記憶體佔用。

開發者整合與使用方式

開發者可透過 sentence-transformers 函式庫(6.1.0 版或更新)載入並執行 EmbeddingGemma 2。安裝時要額外指定 image、audio 與 video 套件,才能使用多模態功能。載入模型時,開發者可用 config_kwargs 參數把不需要的編碼器設為 None。例如把 vision_config 與 audio_config 設為 None,就只會載入 270M 的文字與程式碼模型,節省權重與峰值記憶體配置。

文字與程式碼的嵌入方面,模型訓練時加入了短任務指令,用來引導特定任務的表示。影像、影片、音訊或混合輸入則要以字典形式傳遞資料,並用 <|image|>、<|video|> 或 <|audio|> 標記嵌入位置。不同模態的嵌入來源各異,但都落在同一個維度空間,可以直接做語義相似度比較。

Matryoshka 表示學習與儲存優化

EmbeddingGemma 2 支援 Matryoshka Representation Learning (MRL) 技術,可動態截斷向量維度以降低儲存需求。開發者可透過 truncate_dim 參數,把 768 維向量截斷為 512、256 或 128 維,並搭配 normalize_embeddings=True 取得單位長度向量。查詢與文件必須使用相同的維度設定。

儲存效益方面,以 bfloat16 精度計算,一百萬個 768 維向量約需 1.5 GB 記憶體,截斷到 128 維則只需 250 MB,儲存量減少為六分之一。也就是說,在相同記憶體預算下可以存六倍的嵌入資料,對大型索引的記憶體配置或裝置端部署有幫助。儲存受限或需要提升搜尋速度時,建議使用截斷功能,並確保查詢與索引使用一致的維度。

效能表現與配置建議

根據 MTEB (Code) 基準測試,EmbeddingGemma 2 的表現比前代 EmbeddingGemma 1 高出 14%,同時保留多語言文字準確率,並新增影像、影片與音訊的檢索能力。配置選擇上,需要多模態或視覺文件檢索時,建議使用 768d 或 512d 維度,優先考量召回率。儲存空間受限時,256d 維度可保留文字與程式碼的大部分品質,影像、影片與語音檢索品質則維持在約 95%,並將儲存量降為三分之一。128d 維度適合大型純文字索引,或作為重排序前的初篩階段,文字與程式碼品質約保留 90%,但多模態檢索品質會降到約 75%,部署前需針對目標資料進行驗證。

所有模態共用 8,192 token 的上下文視窗,影片預設每秒取樣一幀,音訊需為 16 kHz 單聲道。開發者可透過 Hugging Face 下載權重,並使用 vLLM、Hugging Face Transformers、SGLang、MLX、Ollama、LMStudio 及 LiteRT 等工具高效運行,或透過 Unsloth 進行高效微調實驗。Google AI Edge Gallery 也提供即時媒體搜尋與影片時刻尋找等裝置端示範。

●開發者:可採用此模型優化多模態檢索系統的記憶體與儲存成本

●投資人:關注 Google 在開源多模態基礎模型領域的佈局

●一般用戶:無直接影響

重要性評分

76/100

🟠 值得關注

EmbeddingGemma 2多模態嵌入開源模型向量資料庫Matryoshka 表示學習
原文出處
下一則Google 即將取消 Gemini Flash 與 Pro 的免費存取權 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。