H Company 发布多模态原生多语言编码器 NeoMME
H Company发布高效的多模态原生多语言编码器模型NeoMME。
AI 深度解读
H Company 正式发布开源多模态多语言双向编码器 NeoMME,为视觉文档检索与跨模态特征提取提供了轻量化的高效架构方案。
- 模型提供 260M 和 800M 两种参数规模,采用 Apache 2.0 协议开源。
- 摒弃传统的独立预训练视觉编码器和自回归解码器结构,采用单一双向 Transformer 原生联合处理文本 token 与图像 patch,基于掩码离散扩散目标从零训练。
- 在视觉文档检索基准 ViDoRe v3 上达到帕累托前沿;在 NVIDIA L40S 上 260M 模型的编码吞吐达每秒 51 页,约为 ColModernVBERT 的 2 倍。
- 结合分层 token 池化与非对称量化技术,将单页晚期交互索引存储从约 1.5 MB 压缩至 6 kB,同时保留了基准测试中 95% 以上的 nDCG@10 检索精度。
- 影响/看点:该方案可能显著降低视觉文档检索与企业多模态检索增强生成(RAG)系统的索引存储开销和计算门槛,但其在复杂版面与多语种超长文档上的泛化表现仍需更大规模的实际部署验证。
- 资料依据:
- Hugging Face 博客(2026-09-03):https://huggingface.co/blog/Hcompany/neomme
本内容由 AI 生成,仅供参考,请注意甄别