ithome
科技
采集 2026-07-24T10:30:02+00:00
阿里开源0.8B文档解析模型OvisOCR2,端到端模型首次超越流水线方法
原始标题:阿里开源 0.8B 文档解析模型 OvisOCR2,端到端模型首次超越流水线方法
来源
ithome
发布时间
2026-07-24T06:48:19
采集批次
2026-07-24-10
字数
714
URL 指纹
cb5166c03fe0ba67
📌 AI 总结(227 字)
阿里云开源文档解析模型OvisOCR2,以96.58分登顶OmniDocBench v1.6榜单,成为首个超越流水线方法的端到端模型。该模型基于Qwen3.5-0.8B后训练,仅0.8B参数即可在一次生成中输出符合阅读顺序的Markdown,覆盖文本、公式、表格和视觉区域。训练融合监督微调、强化学习、在线策略蒸馏和模型融合四阶段流程。模型以Apache 2.0许可证开源,已上线Hugging Face和魔搭平台,兼容vLLM框架,可无缝接入千问生态。
📄 正文(714 字)
阿里云开源发布文档解析模型OvisOCR2,该模型以96.58的综合得分刷新OmniDocBench v1.6榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,官方称"这是文档解析领域迎来技术路线的重要突破"。 ### 端到端模型首次超越流水线方法 文档解析是大模型落地的关键基础设施,企业知识库、RAG检索、智能问答等场景均需将PDF、扫描件等非结构化文档转化为结构化文本。此前该领域由"流水线方法"主导,通常由版面分析模型和内容识别模型两部分组成,前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后拼接输出。这种方式虽成熟,但存在维护成本高、误差累积、部署复杂等固有瓶颈。 OvisOCR2采用端到端技术路线:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。 ### 小参数大能力,0.8B实现SOTA OvisOCR2由Qwen3.5-0.8B后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。 ### 项目已开源发布,无缝融入千问生态 OvisOCR2以Apache 2.0许可证开源,兼容vLLM等主流推理框架,与Qwen3.5推理生态衔接,开发者无需额外适配即可集成。模型已在Hugging Face和魔搭平台上线,技术报告同步发布于arXiv。