微信开源通用多模态嵌入模型 WeMM-Embedding:日调用量达 10 亿次

📡 IT之家2026-09-08 09:02

微信开源通用多模态嵌入模型 WeMM-Embedding,提供三种参数版本并支持图文视频跨模态检索,内部日调用量已达 10 亿次。

AI 深度解读

腾讯微信视觉团队开源了通用多模态嵌入模型 WeMM-Embedding,支持文本、图像、视频与图文交错输入的统一表征,为跨模态检索与多模态系统提供了轻量化部署选项。

  • 架构与规格:根据腾讯 GitHub 仓库与技术报告,WeMM-Embedding 推出 2B、4B 与 9B 三个参数版本,支持俄罗斯套娃嵌入(MRL),可将向量维度从全尺寸灵活裁剪至 64 至 2048 等不同维度以降低存储与检索开销。
  • 评测表现:在多模态基准 MMEB-v2 评测中,9B 版本取得 80.6 的总体平均分,2B 版本(77.9 分)表现亦优于部分此前开源的 8B 基线模型;该模型当前主要聚焦视觉与文本,暂不支持音频输入。
  • 落地与推理支持:研发团队披露该模型已应用于微信视频号推荐、朋友圈搜索、公众号与电商等场景,日均调用量达 10 亿次,同时开源仓库已提供 vLLM 与 SGLang 的推理部署脚本。
  • 影响/看点:该开源意味着开发者能够以较低计算成本构建工业级图文跨模态检索,但实际应用效果仍取决于下游场景的数据分布与向量降维后的精度保持度。
  • 资料依据:
  • GitHub(2026-09-04):https://github.com/Tencent/WeMM-Embedding
  • arXiv(2026-08-28):https://arxiv.org/abs/2608.24053
  • IT之家(2026-09-08):https://www.ithome.com/0/999/527.htm

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手