
探索 WeMM-Embedding:騰訊微信團隊的通用多模態向量模型
在處理視覺資料時,將圖片、影片及複雜文件轉換為向量(Embedding)是多模態應用的核心。騰訊微信視覺團隊近期發布了 WeMM-Embedding,這是一套將文字、影像與影片統一表示的通用多模態向量模型系列,為跨模態檢索、推薦系統及代理(Agentic)工作流提供強大的基建。
這套模型簡化了跨模態檢索與理解的流程,以下是該技術的重點整理。
核心功能與基座架構
WeMM-Embedding 的核心優勢在於它能將多種輸入類型——包含文字、影像、影片、視覺文件以及任意交錯的多模態輸入(Interleaved Multimodal Inputs)——萃取並對齊至同一個統一的向量空間。
- 模型基座:本系列模型是基於強大的 Qwen3.5 系列模型(如 Qwen3.5-2B-Base、Qwen3.5-4B-Base、Qwen3.5-9B-Base)進行微調與開發,繼承了其優異的跨模態理解能力。
- 向量提取機制:開發者只需將多模態資料輸入模型,在指定的
<embedding>專用 token 位置提取最後一層的隱藏狀態(Last-layer Hidden State),隨後進行 L2 正規化(L2 Normalization),即可獲得高品質的向量表示。
模型規格與 Matryoshka 維度自適應技術
WeMM-Embedding 提供了 2B、4B 及 9B 三種參數規模,以對應從輕量級邊端到高精度雲端部署的不同運算需求。
值得注意的是,該系列原生支援 Matryoshka 向量表徵技術(Matryoshka Representation Learning, MRL)。這項技術允許開發者根據實際儲存與檢索效能需求,彈性截斷向量維度,而無須重新訓練模型:
- WeMM-Embedding-2B:支援維度包含 64, 128, 256, 512, 1024, 2048(預設滿維度)。以 2B 模型為例,即便將維度從 2048 大幅縮減至 256,在 MMEB-v2 基準測試上,模型仍能保留高達 98.7% 的影像與影片檢索效能。
- WeMM-Embedding-4B:支援維度包含 64, 128, 256, 512, 1024, 2560(預設滿維度)。
- WeMM-Embedding-9B:支援維度包含 64, 128, 256, 512, 1024, 2048, 4096(預設滿維度)。
這項技術能顯著減少大規模向量檢索系統(如 Vector DB)的儲存硬體成本,並極大地提升首字比對與推論速度。

開發與部署
開發者可以方便地透過主流的 transformers 庫或 SentenceTransformer 直接從 Hugging Face 載入此系列模型進行推理。
1. 安裝相依套件
官方強烈建議鎖定 transformers==5.2.0 以確保預處理行為的一致性與推論結果的精準重現:
pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" "sentence-transformers>=5.7.0" "accelerate>=1.1.0"
2. 高吞吐伺服部署
針對大規模線上檢索服務,該專案已通過以下高效能 serving 框架的整合測試:
- vLLM (0.27.0):
MODEL_PATH=/path/to/WeMM-Embedding-2B vllm serve "$MODEL_PATH" \ --runner pooling \ --chat-template "$MODEL_PATH/embedding_chat_template.jinja" - SGLang (0.5.9):
部署前需要先執行補丁指令:
python patch_sglang_video.py python -m sglang.launch_server \ --model-path "$MODEL_PATH" \ --is-embedding \ --enable-precise-embedding-interpolation
評測表現:問鼎開源多模態 SOTA
WeMM-Embedding 在多項學術及工業基準測試中均展現出極具競爭力的頂尖實力:
MMEB-v2(含 78 個資料集)
評估影像、影片與視覺文件理解能力(影像與影片任務使用 Hit@1,視覺文件任務使用 NDCG@5):
- 2B 變體(均分 77.9):表現極為驚豔,其整體表現已超越了先前領先的 8B 參數開源基準模型(如 Qwen3-VL-Embedding-8B,其均分為 77.8)。
- 9B 變體(均分 80.6):在 MMEB-v2 基準測試上奪得全新 State-of-the-Art (SOTA) 佳績,影像 (81.9)、影片 (74.3) 及視覺文件 (83.3) 分項表現皆居榜首。
MMEB-v3(含 190 個複雜多模態與 Agent 任務)
即使 WeMM-Embedding 目前不支援音訊輸入(在 11 個音訊任務中皆被記為 0 分),但憑藉其強大的文字、Agent、多步檢索 (MCMR) 與視覺文件能力,依然取得了頂尖成績:
- WeMM-Embedding-2B 的 V3-All 達到了 56.0。
- WeMM-Embedding-9B 更以 59.5 的高分在開源模型中傲視群雄(相較之下,Qwen3-VL-Embedding-8B 得分為 53.5)。
根據官方報告,此系列模型已大規模實裝於微信的眾多核心業務,如視頻號(WeChat Channels)、公眾號(Official Accounts)、朋友圈(Moments)以及電商服務,在 14 項線上 A/B 測試中均取得顯著的業務指標提升。
常見問題
Q:是否支援音訊輸入? A:目前僅針對文字、圖片、影片及視覺文件進行了對齊與優化,暫不支援音訊。在評測時若遇到音訊任務,得分將會是 0 分。
Q:如何手動進行向量截斷與重新正規化?
A:如果使用原生 PyTorch,針對預期維度 d,直接截斷後重新進行 L2 正規化即可,操作程式碼如下:
import torch.nn.functional as F
embedding_d = F.normalize(embedding[..., :d], dim=-1)
若使用 SentenceTransformer,則可直接調用內建參數簡化操作:
embeddings_d = model.encode_document(documents, truncate_dim=d, normalize_embeddings=True)
Q:授權條款為何? A:騰訊釋出的 WeMM-Embedding 系列模型採取了非常友好的開源授權。不只是原始碼,Tencent 釋出的模型參數與權重(Weights)也全部採用 Apache License 2.0 授權,非常適合企業或開發者自由進行商業化應用與集成。
WeMM-Embedding 為多模態檢索與視覺理解任務提供了一套靈活、高效且商業友好的解決方案,非常適合當前正進行 RAG、多模態搜尋或推薦系統開發的團隊進行評估與整合。



