微信低调开源生产级多模态嵌入模型 WeMM-Embedding

📡 阿易 AI Notes2026-08-26 23:31

微信开源WeMM-Embedding多模态嵌入模型,支持文本、图片和长视频检索,已用于多项业务。

AI 深度解读

2026年8月26日,X账号“阿易 AI Notes”介绍了腾讯微信视觉团队开源的 WeMM-Embedding 多模态嵌入模型。其关注价值在于,文本、图像、视频和视觉文档被纳入统一向量表示后,搜索和推荐系统可以用更一致的方式处理跨模态内容,同时模型权重和评测代码对开发者开放。

  • 腾讯 WeMM-Embedding 官方 GitHub仓库列出2B、4B和9B三个版本,支持文本、图像、视频、视觉文档及交错多模态输入。
  • 仓库记录的 MMEB-v2评测中,9B版本平均分为80.6;MMEB-v3中,9B版本为59.5。两个分数属于不同评测设置,不能直接互相比较。
  • 官方仓库还显示,2B版本截断到256维后,在 MMEB-v2 的图像和视频任务上保留完整维度表现的98.7%,这是模型方报告的基准结果。
  • 低维向量通常可以减少存储和检索计算,但实际成本还取决于索引结构、数据规模、召回率目标和更新频率。
  • 仓库提供 vLLM 和 SGLang 的部署示例,并注明当前不支持音频输入,因此适用范围仍由模态和工程条件限定。
  • 影响/看点:如果公开权重、低维表示和多模态输入能在真实业务中维持足够召回质量,企业可能降低跨模态检索的接入成本;但榜单成绩不能替代目标数据集上的离线与线上验证。
  • 资料依据:Tencent/WeMM-Embedding GitHub仓库,2026年8月,https://github.com/Tencent/WeMM-Embedding;《WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report》2026年8月,https://arxiv.org/abs/2608.24053;X“阿易 AI Notes”原帖,2026年8月26日,https://x.com/AYi_AInotes/status/2092636087147491496

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手