Google DeepMind 推出開源多模態嵌入模型 EmbeddingGemma 2,支援文字、程式碼、圖片、影片與音訊檢索。本文整理官方技術架構、參數量設計、Matryoshka 維度截斷機制,以及 Unsloth 與 LiteRT 端側部署實作方式,提供開發者建構跨模態 RAG 的具體參考。
Google DeepMind 正式發表新一代開源嵌入模型 EmbeddingGemma 2,相較於前代僅專注於文字領域,這次將向量空間擴展至多模態檢索。開發者能直接將文字、程式碼、影像、視訊與語音檔案對齊至同一個高維度語意空間,大幅簡化跨模態搜尋(Cross-modal Search)與檢索增強生成(RAG)系統的建置流程。
EmbeddingGemma 2 的核心規格與多模態架構
在 Google 發布的 官方開發者指南 中,詳細說明了模型的運作原理與設計取向。EmbeddingGemma 2 的設計核心在於平衡邊緣裝置運算資源與檢索表現,採用模組化結構來應對不同硬體限制。
模組化參數配置
模型完整規模約為 7.4 億(740M)參數,支援所有模態的特徵萃取。為了兼顧資源受限的執行環境,模型具備模組化切分能力,純文字與程式碼處理分支可縮減至約 2.7 億(270M)參數。開發者若僅需處理文字檢索,便不必承載多模態視覺與語音編碼器,能在記憶體受限的環境下維持輕量運算。
原生跨模態對齊能力
過去建構多模態檢索時,常需透過多個獨立編碼器(例如文字使用 BERT 系列,圖片使用 CLIP),再經由投影層(Projection Layer)對齊。EmbeddingGemma 2 在訓練階段即採用統一語意幾何空間,支援文字搜尋圖片、音訊檢索文字、影片切片定位等多種組合,減少管線串接帶來的累積誤差。
Matryoshka 維度截斷與端側部署
對於大規模向量資料庫或行動裝置儲存空間而言,嵌入向量的維度直接影響記憶體占用與相似度比對速度。
MRL 技術彈性縮減維度
EmbeddingGemma 2 延續俄羅斯套娃表示學習(Matryoshka Representation Learning, MRL)技術,預設向量維度為 768 維。開發者可依據系統需求截斷至 512、256 或 128 維,並於截斷後重新進行向量正規化(Normalization)。根據測試數據,適度截斷維度能大幅減少儲存空間與運算負擔,同時保留大部分檢索準確度。
LiteRT 與邊緣運算整合
針對行動端與嵌入式裝置,Google 在 邊緣運算應用文章 指出,該模型已支援 LiteRT(原 TensorFlow Lite)框架。結合硬體加速(如 EdgeTPU 或行動裝置 NPU),使用者能在離線狀態下搜尋個人相簿、語音備忘錄與本機文件,資料無須上傳雲端,兼顧個人隱私與即時反應速度。
Unsloth 微調支援與量化加速
針對需要領域適配(Domain Adaptation)或降低推論門檻的開發者,Unsloth 已同步釋出對應支援。
記憶體優化微調流程
透過 Unsloth 模型庫 提供的 FastSentenceTransformer 工具,開發者可利用 LoRA 或 QLoRA 針對特定專業領域資料集進行微調。Unsloth 的核心優勢在於降低顯存消耗並加快訓練速度,使個人工作站或消費級顯示卡也能順暢完成客製化訓練。
GGUF 量化格式相容
除了標準 Hugging Face 格式權重,社群亦推出了 GGUF 規格與動態量化版本。這些量化格式可直接配合 llama.cpp 或本地推理工具執行,讓 4-bit 與 8-bit 量化模型在一般個人電腦或邊緣設備上運作,進一步降低推論延遲。
常見問題
EmbeddingGemma 2 與第一代 EmbeddingGemma 有何差異?
第一代 EmbeddingGemma 主要是約 3.08 億參數的純文字與程式碼嵌入模型,專注於多語言文字檢索。EmbeddingGemma 2 則擴充為 7.4 億參數的多模態模型,原生支援影像、音訊與影片檢索,並具備可拆卸的模組化架構。
如何在程式碼中使用 MRL 截斷維度?
在 Sentence Transformers 或推論流程中,取得 768 維輸出後,只需保留前 128、256 或 512 個數值,再執行 L2 正規化即可直接用於向量相似度計算。
模型微調時是否一定要高階伺服器 GPU?
不需要。搭配 Unsloth 的 QLoRA 機制,可以在消費級顯示卡(例如 8GB 至 16GB 顯存設備)上進行適配訓練,適合中小型團隊建立內部專用檢索模型。
結語
EmbeddingGemma 2 將開源嵌入模型的應用範疇由純文字擴展至圖片、聲音與視訊,提供統一的語意空間基礎。藉由模組化參數量、MRL 維度彈性調整,以及 Unsloth 與 LiteRT 的生態支援,開發者能夠因應不同硬體規格彈性配置,為本機多模態檢索與邊緣端 RAG 應用提供可落地的技術選擇。

