EmbeddingGemma 2 裝置端多模態嵌入
740M 參數統一文字圖像音訊影片,一頁看懂規格與 HN 反應
Lead: EmbeddingGemma 2 把文字、程式碼、圖像、音訊、影片放進同一個向量空間,7.4 億參數,Apache 2.0,可完全離線跑。
速覽
- 模型
- EmbeddingGemma 2,基於 Gemma 4
- 參數
- 740M,可拆,文字 270M,視覺 170M,音訊 300M
- 授權
- Apache 2.0,可商用
- 上下文
- 8K token,前代 4 倍
- 記憶體
- Pixel 11 Pro 量化後文字 191MB,全模態 567MB
- 輸入上限
- 5.5 分鐘音訊,29 張圖,58 格影格
五大特色
- 同級最佳:10 億參數以下多模態嵌入領先,文字、視覺、音訊都強。
- 模組化:純文字只載 270M,需要再加視覺、音訊編碼器。
- 省儲存:MRL 可把 768 維截到 512、256、128 維,最高省 6 倍。
- 裝置端:量化後記憶體低,可離線跑,保護隱私,降低延遲。
- 長上下文:8K token,可吃交錯的多模態輸入。
怎麼運作
效能重點
| 項目 | 數據 | 說明 |
|---|---|---|
| 程式碼檢索 | 78.68 分 | 前代 68.76,大漲 9.92 分 |
| 文字多語言 | 持平 | 維持前代水準 |
| 圖音品質 | 超專用模型 | 參數兩倍大的專用模型也被超車 |
| 儲存 | 最高省 6 倍 | 768 維可砍到 128 維 |
| 速度 M3 Pro | 文 78 筆每秒 | 圖 4 筆,音 6 筆,影片每分鐘 0.2 筆 |
HN 怎麼看
| 立場 | 論點 |
|---|---|
| 讚授權 | 嵌入要存百萬向量,封閉模型下架就要重算,開權重才能避險 |
| 讚拆分 | 純文字 270M 剛好,文字加視覺 440M 也合理 |
| 追問 | MRL 只省儲存,不省權重,想要 MatFormer 式縮模型 |
| 實測 | 官方分類範例翻車,financial 只給 0.22,對手 Laya 較準 |
| 質疑 | 為何不比 SigLIP2,不能做 OCR,Voyage 在利基領域仍強 |
拿來做什麼
- 媒體庫語意搜尋:用文字或圖片找最像的照片影片。
- 影片時刻定位:用文字或音訊查到特定片段。
- 本地 RAG:EmbeddingGemma 2 檢索,Gemma 4 推理,共用斷詞器,記憶體更省。
- 即時決策:接 MediaPipe Decision Task,做分類、分流、預測。
- 開發工具:支援 transformers,sentence-transformers,MLX,vLLM,llama.cpp,Ollama,LMStudio,瀏覽器可用 transformers.js。
HN 一句話總結
開權重加模組化是對的方向,裝置端多模態搜尋終於有堪用的中尺寸模型。