阿里开源0.8B文档解析模型OvisOCR2,端到端首次超越流水线方案
阿里云开源0.8B文档解析模型OvisOCR2,在OmniDocBench v1.6得96.58分登顶,首次以端到端方案超越流水线方法。
AI 深度解读
阿里云开源发布0.8B参数的文档解析模型OvisOCR2,以端到端方案首次在OmniDocBench v1.6榜单上超越传统流水线方法并登顶。
- OvisOCR2以96.58的综合得分刷新榜单纪录,是该榜单上首个反超「版面分析+内容识别」两段式流水线的端到端模型
- 输入一张文档图像即可一次生成符合自然阅读顺序的Markdown输出,覆盖文本、公式、表格与视觉区域,免去多模型拼接带来的误差累积与部署复杂度
- 模型由Qwen3.5-0.8B后训练得到,团队构建真实文档与合成文档互补的数据引擎,合成数据专门补足表格公式交织、多栏版式、长输出等难点场景
- 训练流程按监督微调、强化学习、在线策略蒸馏与模型融合四阶段递进,充分挖掘小参数模型的潜力
- 项目以Apache 2.0协议开源,兼容vLLM等主流推理框架,可直接接入千问生态无需额外适配
- 影响/看点:0.8B的小体量做到端到端反超流水线的SOTA,意味着企业知识库、RAG检索等场景的文档解析成本有望大幅下降,也给「大而全流水线」路线敲响警钟。
本内容由 AI 生成,仅供参考,请注意甄别