跳到正文
hackernews100· ilreb·· 8 小時前精選AI 評分72

EmbeddingGemma 2:開源輕量化多模態嵌入模型

EmbeddingGemma 2: An open, lightweight multimodal embedding model

AI 導讀

EmbeddingGemma 2 是 Google DeepMind 推出的 740M 引數、開源(Apache 2.0)多模態嵌入模型,支援文字、影像、音訊與影片的統一向量化,並可在邊緣裝置上高效執行。

推薦理由

EmbeddingGemma 2 以 740M 引數提供高效多模態嵌入,開源 Apache 2.0 讓開發者可在邊緣裝置上構建離線搜尋與 RAG 系統。

正文 · AI 翻譯

Oct 06, 2026

|

EmbeddingGemma 2 是最能夠在裝置上進行多模態嵌入的模型,能原生將文字、影像、音訊與影片的組合對映到統一的嵌入空間。


Sahil Dua

Research Engineer, Google DeepMind

Henrique Schechter Vera

Research Engineer, Google DeepMind


EmbeddingGemma 2

收聽文章

[[duration]] minutes

此內容由 Google AI 生成。生成式 AI 仍為實驗性技術。

我們於去年推出了 EmbeddingGemma,提供輕量級的高品質文字嵌入方案,協助您的應用程式直接在消費者硬體上組織、搜尋並連結資訊。開發者社群的回應遠超預期。超過 2000 萬次下載,建置者已將其用於打造更聰明的裝置搜尋工具與以隱私為首的檢索增強生成(RAG)流程。

今天,我們推出 EmbeddingGemma 2, 擴充套件至文字之外,將程式碼、影像、影片與音訊統一於共享嵌入空間。此模型基於 Gemma 4 架構,並以商業友好的 Apache 2.0 授權釋出,擁有 7.4 億引數,最適合在裝置上推論。它能協助從語音備忘錄中尋找特定影片片段,或根據文字查詢搜尋數小時的音訊紀錄,所有皆由單一、原生多模態模型處理。

使用與 Gemini Embedding 模型相同技術構建,EmbeddingGemma 2 是:

  • 同尺寸最佳: 在 MTEB (Massive Text Embedding Benchmark) Code 和 MAEB (Massive Audio Embedding Benchmark) 等基準中,達到子 1B 多模態嵌入器中領先分數,並在文本、視覺和音訊任務上匹配或超越許多更大模型。
  • 設計模組化: 只需 270M 引數即可處理純文本工作負載,並可選擇性使用 170M 視覺編碼器和 300M 音訊編碼器以提供完整多模態支援。
  • 儲存效率高: 透過 Matryoshka Representation Learning (MRL),開發者可以動態將輸出向量從 768 維降至 512、256 或 128 維,從而在本地向量資料庫和記憶體使用上實現最高 6 倍的儲存縮減。
  • 最佳化於裝置端效能: 在嚴格資源限制下高效執行。使用量化技術,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 只需約 191MB 活動 RAM 來載入純文本權重,完整多模態模型則需約 567MB。
  • 擴充上下文已就緒: 擁有 8K 令牌上下文視窗(比 EmbeddingGemma 1 大 4 倍),可直接在本地硬體上處理多達 5.5 分鐘音訊、29 張圖片、58 幀影片,或其交錯組合。

在程式碼、視覺與音訊領域達到頂級品質

EmbeddingGemma 2 與 EmbeddingGemma 具有相同的強大多語言文本表現,同時在程式碼表現上提升 9.92 分(MTEB Code 從 68.76 到 78.68),使其非常適合本地程式碼庫索引、語義程式碼搜尋與程式碼代理檢索。在影像、影片、檔案與音訊領域,它為子 1B 模型設定了新的質量/引數標準,甚至在許多專用模型的質量上超越其兩倍以上。

Massive Text Embedding Benchmark (Code)

Massive Image Embedding Benchmark (Lite)

Massive Audio Embedding Benchmark

在 EmbeddingGemma 2 model card 中查閱完整的評估指標與模型資訊。

完全在裝置端啟用語義搜尋、路由與檢索

EmbeddingGemma 2 將強大的功能直接帶到邊緣硬體。區域性生成嵌入可確保資料隱私、降低管線延遲,並使開發者能夠構建完全離線運作的跨模態搜尋與檢索。

與 Gemma 4 等生成模型配合,EmbeddingGemma 2 使在裝置上執行 RAG 管線成為可能,能理解複雜的多模態資料。因為 EmbeddingGemma 2 建構於 Gemma 4,並共用其文字分詞器與音訊編碼器,開發者可將兩模型一起在統一管線中執行,總記憶體佔用更低。

欲瞭解如何使用 LiteRT 建置裝置端搜尋與 RAG 系統,請閱讀 Google AI Edge blog post。

開始使用 EmbeddingGemma 2

我們與以下合作夥伴密切合作,確保 EmbeddingGemma 2 在您開發的地方即時運作:

  • 下載模型:在 Hugging Face 與 Kaggle 找到模型權重,Gemini Enterprise Agent Platform Model Garden 也即將上架。前往 LiteRT Community on Hugging Face 下載為裝置最佳化的模型。
  • 裝置端部署:使用 Google AI Edge MediaPipe 開發跨平臺應用,完成嵌入、檢索與決策任務,或使用 LiteRT 進行自訂模型整合。使用 transformers.js 或 WebGPU 為瀏覽器構建。
  • 使用您喜愛的開發工具:使用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 與 LMStudio 高效服務模型。將嵌入向量儲存於 Qdrant。
  • 微調:參照 Unsloth 的指引,學習如何為您的使用情境微調 EmbeddingGemma 2。

瀏覽我們的 developer guide、documentation,以及針對 inference 與 fine-tuning 的說明檔案。

來源:hackernews100 · blog.google