微信开源多模态嵌入模型 WeMM-Embedding,已支撑十亿级日调用
微信开源WeMM-Embedding多模态嵌入模型,提供2B、4B、9B版本,日调用量达十亿级。
AI 深度解读
腾讯微信视觉团队开源 WeMM-Embedding 多模态嵌入模型,提供 2B、4B、9B 三个版本,关注价值在于文本、图像、视频和视觉文档能否由同一表示空间支持检索与推荐。
- 论文《WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report》于 2026-08-25 提交,明确列出三种参数规模和多模态输入范围。
- 论文报告称,9B 版本在 MMEB-v2 上取得 80.6 分,2B 版本为 77.9 分;这些数字属于论文所述评测结果,不等同于所有业务场景的效果。
- GitHub 仓库说明模型支持文本、图片、视频、视觉文档及交错输入,当前不支持音频,并提供推理与服务示例。
- 论文还称模型已用于微信推荐和搜索相关应用,但“十亿级日调用”属于腾讯方面披露,外部难以仅凭公开材料复核。
- 影响/看点:如果开源权重、代码和评测流程能被社区复现,企业可能降低多模态检索系统的自研门槛;实际收益仍取决于领域数据、部署成本、向量库规模和线上延迟。
- 资料依据:
- WeMM-Embedding 技术报告(2026-08-25):https://arxiv.org/abs/2608.24053
- Tencent WeMM-Embedding GitHub 仓库(2026-09-04):https://github.com/Tencent/WeMM-Embedding
本内容由 AI 生成,仅供参考,请注意甄别