阿里开源0.8B文档解析模型,端到端模型首次超越流水线方法
创始人
2026-07-24 20:47:26
0

IT之家 7 月 24 日消息,今日,阿里云开源发布文档解析模型 OvisOCR2。该模型以 96.58 的综合得分刷新 OmniDocBench v1.6 榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,官方称“这是文档解析领域迎来技术路线的重要突破”。

端到端模型首次超越流水线方法

IT之家从官方公告获悉,文档解析是大模型落地的关键基础设施,企业知识库、RAG 检索、智能问答等场景均需将 PDF、扫描件等非结构化文档转化为结构化文本。

此前该领域由“流水线方法”主导,通常由版面分析模型和内容识别模型两部分组成,前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后拼接输出。这种方式虽成熟,但存在维护成本高、误差累积、部署复杂等固有瓶颈。

OvisOCR2 采用端到端技术路线:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的 Markdown 表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。

在 OmniDocBench v1.6 上以 96.58 分登顶,首次证明端到端模型可超越流水线方法。

小参数大能力,0.8B 实现 SOTA

OvisOCR2 由 Qwen3.5-0.8B 后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。

▲ OvisOCR2 数据引擎体系 项目已开源发布,无缝融入千问生态

OvisOCR2 以 Apache 2.0 许可证开源,兼容 vLLM 等主流推理框架,与 Qwen3.5 推理生态衔接,开发者无需额外适配即可集成。

模型获取方式

相关内容

热门资讯

瑞银:不认为中国AI行业存在“... 人民财讯7月24日电,7月24日,瑞银证券中国互联网行业分析师熊玮在回复证券时报·e公司记者表示,中...
对话曾鸣教授:AI时代,企业竞... 7月17日,2026世界人工智能大会在上海开幕。作为36氪连续第三年深入WAIC现场的重要内容窗口,...
“用AI战胜中国汽车” “欧洲汽车制造商有一个机会,在产品研发领域能够追赶上——潜在甚至能够超越中国对手。”NeuralCo...
全球权威机构5份AI报告出炉,... Token数字,好像成了衡量AI产业热度最直观的指标。模型跑一次消耗多少Token,调用一次API花...
7月24日兴业银锡跌6.61%... 证券之星消息,7月24日兴业银锡(000426)跌6.61%,收盘报31.37元,换手率3.95%,...
工信部:“开源”被首次提升到A... 7月23日,2026年亚太经合组织(APEC)数字和人工智能部长会议新闻发布会在成都召开。工业和信息...
阿里开源0.8B文档解析模型,... IT之家7月24日消息,今日,阿里云开源发布文档解析模型OvisOCR2。该模型以96.58的综合得...
开源控股(01215.HK)7... 证券之星消息,截至2026年7月24日收盘,开源控股(01215.HK)报收于0.02港元,与上一交...