EmbeddingGemma 2 裝置端多模態嵌入

740M 參數統一文字圖像音訊影片,一頁看懂規格與 HN 反應

sourceGoogle Blog 2026-10-06 + HN 225 points 29 則留言

Lead: EmbeddingGemma 2 把文字、程式碼、圖像、音訊、影片放進同一個向量空間,7.4 億參數,Apache 2.0,可完全離線跑。

A

速覽

模型
EmbeddingGemma 2,基於 Gemma 4
參數
740M,可拆,文字 270M,視覺 170M,音訊 300M
授權
Apache 2.0,可商用
上下文
8K token,前代 4 倍
記憶體
Pixel 11 Pro 量化後文字 191MB,全模態 567MB
輸入上限
5.5 分鐘音訊,29 張圖,58 格影格
B

五大特色

  • 同級最佳:10 億參數以下多模態嵌入領先,文字、視覺、音訊都強。
  • 模組化:純文字只載 270M,需要再加視覺、音訊編碼器。
  • 省儲存:MRL 可把 768 維截到 512、256、128 維,最高省 6 倍。
  • 裝置端:量化後記憶體低,可離線跑,保護隱私,降低延遲。
  • 長上下文:8K token,可吃交錯的多模態輸入。
C

怎麼運作

查詢詞轉向量媒體庫先編好向量30 秒一切塊每秒取 1 格找最近鄰語意搜尋,影片定位,RAGMediaPipe 分類分流預測文字統一嵌入圖像音訊影片搜尋應用決策
D

效能重點

項目 數據 說明
程式碼檢索 78.68 分 前代 68.76,大漲 9.92 分
文字多語言 持平 維持前代水準
圖音品質 超專用模型 參數兩倍大的專用模型也被超車
儲存 最高省 6 倍 768 維可砍到 128 維
速度 M3 Pro 文 78 筆每秒 圖 4 筆,音 6 筆,影片每分鐘 0.2 筆
E

HN 怎麼看

立場 論點
讚授權 嵌入要存百萬向量,封閉模型下架就要重算,開權重才能避險
讚拆分 純文字 270M 剛好,文字加視覺 440M 也合理
追問 MRL 只省儲存,不省權重,想要 MatFormer 式縮模型
實測 官方分類範例翻車,financial 只給 0.22,對手 Laya 較準
質疑 為何不比 SigLIP2,不能做 OCR,Voyage 在利基領域仍強
F

拿來做什麼

  • 媒體庫語意搜尋:用文字或圖片找最像的照片影片。
  • 影片時刻定位:用文字或音訊查到特定片段。
  • 本地 RAG:EmbeddingGemma 2 檢索,Gemma 4 推理,共用斷詞器,記憶體更省。
  • 即時決策:接 MediaPipe Decision Task,做分類、分流、預測。
  • 開發工具:支援 transformers,sentence-transformers,MLX,vLLM,llama.cpp,Ollama,LMStudio,瀏覽器可用 transformers.js。
HN 一句話總結

開權重加模組化是對的方向,裝置端多模態搜尋終於有堪用的中尺寸模型。