阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

来源:AI创业之家· 2026-07-24 14:58:37

7月24日,阿里巴巴宣布开源发布仅0.8B参数规模的文档解析模型OvisOCR2。在权威文档解析基准OmniDocBench v1.6评估中,该模型以96.58的综合得分登顶,成为首个全面超越传统流水线方法的端到端文档解析模型,标志着文档智能技术领域迎来突破性范式转折。

QQ20260724-140219.jpg

作为RAG检索、智能问答与企业知识库的核心基础设施,文档解析长期由“版面分析+内容识别”的流水线串联模式主导,面临维护成本高、误差逐级累积及部署复杂等瓶颈。基于Qwen3.5-0.8B后训练的OvisOCR2突破了上述限制,仅凭单模型一次生成即可按自然阅读顺序输出包含文本、公式、表格与视觉区域的Markdown表示。

在技术实现上,模型结合真实与合成数据互补的技术路径,并通过监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)及模型融合四大手段充分释放紧凑模型的潜力。

目前,OvisOCR2已基于Apache2.0协议在Hugging Face及魔搭社区全面开源,兼容vLLM等主流推理框架,可无缝无感接入千问生态。凭借小参数高效能的部署优势,该模型的推出大幅降低了高精度文档解析的显存与算力门槛,推动文档智能从复杂的系统工程向更简洁的高效模型驱动演进。


[免责声明]如需转载请注明原创来源;本站部分文章和图片来源网络编辑,如存在版权问题请发送邮件至398879136@qq.com,我们会在3个工作日内处理。非原创标注的文章,观点仅代表作者本人,不代表本站立场。

相关推荐
AI创业之家
转人工 ×