tool

騰訊推出 WeMM-Embedding:全新多模態向量嵌入模型,支援影像與影片檢索

August 28, 2026
Updated Aug 28
2 min read
騰訊推出 WeMM-Embedding:全新多模態向量嵌入模型,支援影像與影片檢索

探索 WeMM-Embedding:騰訊微信團隊的通用多模態向量模型

在處理視覺資料時,將圖片、影片及複雜文件轉換為向量(Embedding)是多模態應用的核心。騰訊微信視覺團隊近期發布了 WeMM-Embedding,這是一套將文字、影像與影片統一表示的通用多模態向量模型系列,為跨模態檢索、推薦系統及代理(Agentic)工作流提供強大的基建。

這套模型簡化了跨模態檢索與理解的流程,以下是該技術的重點整理。

圖片來源: GitHub - Tencent/WeMM-Embedding: WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval. · GitHub

核心功能與基座架構

WeMM-Embedding 的核心優勢在於它能將多種輸入類型——包含文字、影像、影片、視覺文件以及任意交錯的多模態輸入(Interleaved Multimodal Inputs)——萃取並對齊至同一個統一的向量空間。

  • 模型基座:本系列模型是基於強大的 Qwen3.5 系列模型(如 Qwen3.5-2B-Base、Qwen3.5-4B-Base、Qwen3.5-9B-Base)進行微調與開發,繼承了其優異的跨模態理解能力。
  • 向量提取機制:開發者只需將多模態資料輸入模型,在指定的 <embedding> 專用 token 位置提取最後一層的隱藏狀態(Last-layer Hidden State),隨後進行 L2 正規化(L2 Normalization),即可獲得高品質的向量表示。

模型規格與 Matryoshka 維度自適應技術

WeMM-Embedding 提供了 2B、4B 及 9B 三種參數規模,以對應從輕量級邊端到高精度雲端部署的不同運算需求。

值得注意的是,該系列原生支援 Matryoshka 向量表徵技術(Matryoshka Representation Learning, MRL)。這項技術允許開發者根據實際儲存與檢索效能需求,彈性截斷向量維度,而無須重新訓練模型:

  • WeMM-Embedding-2B:支援維度包含 64, 128, 256, 512, 1024, 2048(預設滿維度)。以 2B 模型為例,即便將維度從 2048 大幅縮減至 256,在 MMEB-v2 基準測試上,模型仍能保留高達 98.7% 的影像與影片檢索效能。
  • WeMM-Embedding-4B:支援維度包含 64, 128, 256, 512, 1024, 2560(預設滿維度)。
  • WeMM-Embedding-9B:支援維度包含 64, 128, 256, 512, 1024, 2048, 4096(預設滿維度)。

這項技術能顯著減少大規模向量檢索系統(如 Vector DB)的儲存硬體成本,並極大地提升首字比對與推論速度。

WeMM-Embedding Performance Overview

圖片來源: WeMM-Embedding Performance Overview

開發與部署

開發者可以方便地透過主流的 transformers 庫或 SentenceTransformer 直接從 Hugging Face 載入此系列模型進行推理。

1. 安裝相依套件

官方強烈建議鎖定 transformers==5.2.0 以確保預處理行為的一致性與推論結果的精準重現:

pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" "sentence-transformers>=5.7.0" "accelerate>=1.1.0"

2. 高吞吐伺服部署

針對大規模線上檢索服務,該專案已通過以下高效能 serving 框架的整合測試:

  • vLLM (0.27.0)
    MODEL_PATH=/path/to/WeMM-Embedding-2B
    vllm serve "$MODEL_PATH" \
      --runner pooling \
      --chat-template "$MODEL_PATH/embedding_chat_template.jinja"
    
  • SGLang (0.5.9): 部署前需要先執行補丁指令:
    python patch_sglang_video.py
    python -m sglang.launch_server \
      --model-path "$MODEL_PATH" \
      --is-embedding \
      --enable-precise-embedding-interpolation
    

評測表現:問鼎開源多模態 SOTA

WeMM-Embedding 在多項學術及工業基準測試中均展現出極具競爭力的頂尖實力:

MMEB-v2(含 78 個資料集)

評估影像、影片與視覺文件理解能力(影像與影片任務使用 Hit@1,視覺文件任務使用 NDCG@5):

  • 2B 變體(均分 77.9):表現極為驚豔,其整體表現已超越了先前領先的 8B 參數開源基準模型(如 Qwen3-VL-Embedding-8B,其均分為 77.8)。
  • 9B 變體(均分 80.6):在 MMEB-v2 基準測試上奪得全新 State-of-the-Art (SOTA) 佳績,影像 (81.9)、影片 (74.3) 及視覺文件 (83.3) 分項表現皆居榜首。

MMEB-v3(含 190 個複雜多模態與 Agent 任務)

即使 WeMM-Embedding 目前不支援音訊輸入(在 11 個音訊任務中皆被記為 0 分),但憑藉其強大的文字、Agent、多步檢索 (MCMR) 與視覺文件能力,依然取得了頂尖成績:

  • WeMM-Embedding-2B 的 V3-All 達到了 56.0
  • WeMM-Embedding-9B 更以 59.5 的高分在開源模型中傲視群雄(相較之下,Qwen3-VL-Embedding-8B 得分為 53.5)。

根據官方報告,此系列模型已大規模實裝於微信的眾多核心業務,如視頻號(WeChat Channels)、公眾號(Official Accounts)、朋友圈(Moments)以及電商服務,在 14 項線上 A/B 測試中均取得顯著的業務指標提升。

常見問題

Q:是否支援音訊輸入? A:目前僅針對文字、圖片、影片及視覺文件進行了對齊與優化,暫不支援音訊。在評測時若遇到音訊任務,得分將會是 0 分。

Q:如何手動進行向量截斷與重新正規化? A:如果使用原生 PyTorch,針對預期維度 d,直接截斷後重新進行 L2 正規化即可,操作程式碼如下:

import torch.nn.functional as F

embedding_d = F.normalize(embedding[..., :d], dim=-1)

若使用 SentenceTransformer,則可直接調用內建參數簡化操作:

embeddings_d = model.encode_document(documents, truncate_dim=d, normalize_embeddings=True)

Q:授權條款為何? A:騰訊釋出的 WeMM-Embedding 系列模型採取了非常友好的開源授權。不只是原始碼,Tencent 釋出的模型參數與權重(Weights)也全部採用 Apache License 2.0 授權,非常適合企業或開發者自由進行商業化應用與集成。


WeMM-Embedding 為多模態檢索與視覺理解任務提供了一套靈活、高效且商業友好的解決方案,非常適合當前正進行 RAG、多模態搜尋或推薦系統開發的團隊進行評估與整合。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.