阿里巴巴造出0.8B超小文档解析神器,端到端解析时代来了?

📅 2026/7/24 22:56:26 👁️ 阅读次数 📝 编程学习
阿里巴巴造出0.8B超小文档解析神器,端到端解析时代来了?

这篇来自阿里巴巴集团ATH-MaaS团队的技术报告发布于2026年7月15日,论文编号为arXiv:2607.13639,有兴趣深入了解的读者可以通过该编号检索完整论文。

每天,无数人面临同一个痛苦:手里有一叠扫描件、PDF报告或者拍照的文件,需要把里面的文字、表格、公式统统整理出来,再用于后续分析、检索或者喂给AI工具。传统的解决方案要么靠人工手打,要么靠一套复杂的软件流水线——先识别版面,再裁出每个区域,再分别识别文字、表格、数学公式,最后拼在一起。这套流程就像在流水线工厂里生产产品:每个工位做一道工序,任何一道出了岔子,后面的工位都得跟着受罪。漏掉了一个表格边界,整个表格的内容就废了;公式裁歪了,识别结果就会面目全非。

阿里巴巴的研究团队决定换一条路:既然流水线问题多,为什么不让一个"全能工人"直接从头到尾搞定所有事情?这个"全能工人"就是OvisOCR2——一个仅有8亿参数规模的端到端文档解析模型。说"仅有8亿",是因为它的竞争对手里有不少超过百亿甚至千亿参数的模型,而OvisOCR2在主流评测榜单OmniDocBench v1.6上拿下了96.58的综合得分,不仅在所有端到端模型里排名第一,还把此前长期霸榜的流水线方法全部甩在了身后。

---

一、文档解析这件事,为什么这么难?

要真正理解OvisOCR2的价值,得先明白"把一张文档图片变成结构化文字"这件事有多复杂。

普通人看一页文档,眼睛和大脑会自动完成很多工作:哪里是标题、哪里是正文、哪里是表格、哪里是图注、哪里是页眉页脚、哪里是数学公式,以及整页内容应该按什么顺序阅读——特别是遇到双栏排版的学术论文时,阅读顺序并不是从左上角到右下角一撸到底,而是先读完左栏,再读右栏。这些对人类来说习以为常的判断,对机器来说极其复杂。

现有方法大致分两派。一派是流水线方法,代表选手包括PaddleOCR-VL-1.6、MinerU2.5-Pro和GLM-OCR。这些系统把一页文档拆成多个子任务,各配一个专门的模型:版面分析模型先把页面切成一块一块,然后针对每个区域分别调用文字识别模型、公式识别模型、表格结构识别模型,最后再由一个模块负责把所有结果按阅读顺序拼在一起。这种分工协作的方式在主流评测上表现不错,但每个环节都可能出错,且部署时需要同时维护多个模型,运维成本很高。

另一派是端到端方法:用一个统一的模型,接收整张文档图片,直接输出完整的Markdown格式文本——文字、表格(用HTML格式保留结构)、公式(用LaTeX格式保留数学结构)以及图片位置信息,一次生成。这类方法部署简单,模型可以在生成过程中利用页面的整体上下文,不会因为某个区域裁剪不准而丢失信息。然而在此前,端到端方法的解析质量普遍落后于流水线方法,尤其是在复杂表格和长文档上。

OvisOCR2要做的,就是用端到端方法打败流水线方法。

---

二、数据是根基——两条流水线并行建设

研究团队把打造OvisOCR2的过程比作建房子,地基就是训练数据。如果数据质量差,模型再大也是烂泥扶不上墙。为了获得足够高质量、足够多样的训练数据,团队设计了两条并行的数据管道:真实文档数据管道和合成文档数据管道。

真实文档数据管道的逻辑是:大量真实世界的文档图片,天然包含了各种字体、扫描质量、版面样式、语言种类,是任何合成数据都难以完全模拟的"现实感"来源。但真实文档的麻烦在于,你无法直接知道它的"正确答案"是什么,必须先用现有的OCR工具解析出结果,再把这些结果当作训练标签。

团队选用了PaddleOCR-VL-1.5和MinerU2.5-Pro这两个专业解析工具来获取结构化输出。这两个工具返回的是JSON格式的结构化数据,而不是直接可用的Markdown文本。研究团队专门编写了一套基于规则的转换器,把这些JSON结果统一转换为标准Markdown格式。转换规则非常细致:文字块如何归并(相邻的同类文字块要合并,中文直接拼接,非中文要加空格)、标题层级如何从编号格式(如"1.2节"、"第三章")自动推断、数学公式如何规范化(把各种写法统一成`$...$`或`$$...$$`格式)、表格是否有效(空表格、格式损坏的表格直接过滤掉)、图片区域如何用标准化的HTML图片标签表示(坐标归一化到0到1000的范围内)。

光靠自动规则还不够,团队还设置了人工抽查环节。他们按照数据来源、解析工具类型、文档领域和转换配置把数据分成不同子集,从每个子集里随机抽取样本,人工对照原图检查:文字有没有漏掉、公式渲染对不对、表格行列对不对、图片标注框框得准不准、阅读顺序有没有错乱。遇到偶尔有小错的子集,保留但同时保留自动过滤;遇到频繁出错的子集,直接剔除。这种"宁缺毋滥"的保守策略,确保进入训练集的数据整体质量可靠。

合成文档数据管道则解决了另一个问题:真实文档里有些结构非常罕见,比如跨多行多列合并单元格的复杂表格、公式和文字密集交织的学术页面、极端多栏排版等。靠自然收集到这些样本的概率很低,但这些恰恰是模型容易犯错的"硬核场景"。

合成数据管道的核心思路是"从同一个源头同时生成图片和答案",彻底消除标注误差。具体做法是:先收集那些让模型犯错的"难样本"(包括在真实测试中出错的案例和模型自测中暴露的弱点),然后用多模态大语言模型分析这些难样本的视觉结构,生成对应的HTML模板。这个HTML模板保留了难样本的关键布局特征,同时暴露出可以随机化的变量。接着,一个基于代理的自动生成流程会把这个模板扩展成大量变体:内容层面可以随机替换文字、数值、公式、专业术语;结构层面可以随机改变表格结构、章节层级、页面组织方式和图片位置。

最终,这个HTML页面被用Playwright渲染成真实的文档图片,同时从HTML的DOM结构中直接提取Markdown格式的标准答案。因为图片和答案来自同一个HTML源头,标注精度理论上是完美的——不存在"OCR识别错了导致标注错了"的问题。每一批生成的样本还要经过质量控制:检查渲染是否正常、Markdown是否有效、坐标是否对齐,最后才能进入训练集。

通过这两条并行管道,训练数据同时具备了真实文档的自然多样性和合成数据的精准覆盖性。

---

三、训练的四道工序——从"会做"到"做好"

数据准备好之后,真正的训练过程分四个阶段,就像把生铁逐步锻造成精钢。

第一道工序是监督微调(SFT)。这个阶段的目标是让模型"学会做文档解析这件事",用全量数据进行标准的语言模型训练——给模型看文档图片,让它预测正确的Markdown输出。研究团队同时训练了两个规格的模型:0.8B参数的小模型(最终部署目标)和4B参数的大模型(作为后续阶段的"老师")。0.8B模型训练了两个完整轮次,4B模型为了节省计算成本只训练了20%的轮次。

第二道工序是强化学习(RL)。SFT阶段的训练靠"逐个词预测是否正确"来驱动,但文档解析的很多错误并不体现在单个词上——比如一个表格的文字内容全对,但行列结构乱了;一个公式逐字母看都没错,但整体含义完全不同。这些结构性错误更适合用"整体评分"来衡量。

研究团队使用了GRPO(组相对策略优化)算法来做强化学习:让模型对同一张文档图片生成多个不同的输出,然后用奖励函数给每个输出打分,鼓励模型更多地生成高分输出、少生成低分输出。奖励函数由三个分量组成:文字部分用归一化编辑距离的反值衡量(文字越准确分越高)、公式部分用CDM(字符检测匹配)这个图像级别的渲染对比指标(能渲染出一样图形的公式才算对)、表格部分用TEDS(树编辑距离相似度)衡量(表格的行列结构和内容都要对才算分)。最终奖励是页面中实际出现的元素类型的分量平均值:纯文字页面只考察文字分,含公式的页面额外考察公式分,含表格的页面额外考察表格分。

强化学习只在4B模型上进行,而不是直接在0.8B模型上进行。这是有原因的:研究团队实际测试发现,直接对0.8B模型做强化学习,训练过程中策略偏离(KL散度)会越来越大,表格质量在训练后期甚至出现下滑。而4B模型容量更大,能更稳定地吸收强化学习的梯度信号,训练过程保持平稳,表格TEDS指标稳步提升。

为了让强化学习的数据更有效,团队还做了"在线难样本筛选":先用当前策略跑一遍候选页面,把太简单(模型每次都答对)和太难(模型每次都答错)的页面过滤掉,重点保留那些模型有时候答得好、有时候答得差的中等难度页面——这些页面才能给模型提供最有价值的学习信号。

第三道工序是在线策略蒸馏(OPD)。现在有了一个"学习好、能力强"的4B教师模型,怎么把它的能力传递给部署用的0.8B学生模型?标准的知识蒸馏方法是让教师模型生成文本,然后学生模型去模仿。但研究团队用了一个更精妙的方式:让学生模型先自己生成一段输出,然后教师模型来评价这段输出的每个位置上各个词的概率分布,学生再根据教师的评价调整自己的概率分布。

这种方式的好处是,学生始终在针对自己实际生成的内容进行改进——就像一个学生做了一套题,老师批改并指出每道题哪个选项应该选、为什么,学生据此修正自己的思维模式。更重要的是,这里使用的是"反向KL散度"方向的对齐——简单说,这种方向的对齐会让学生集中学习教师最有把握的那些选择,而不是被强迫去覆盖教师所有可能的输出。

在工程实现上,全词汇表的概率对齐计算量太大(每个位置都要算几万个词的概率),研究团队只保留学生当前概率最高的前k个词,只在这个小集合里对齐教师和学生的分布,大幅降低计算量,同时对长文档使用分块投影来降低内存峰值。

第四道工序是模型融合。研究团队训练了多个使用不同数据配比和训练配置的候选模型,最后对这些候选模型的权重做加权平均,得到最终的OvisOCR2。这种做法类似于多个厨师各自做出了稍有差异的菜,最后调出一个融合了各自优点的配方——通常能比单个模型更稳定、泛化性更好。

---

四、评测:三个战场,全面出击

OvisOCR2在三个评测场景下接受了检验,分别是两个公开榜单和一个内部评测集。

第一个战场是OmniDocBench v1.6,这是文档解析领域目前最权威的公开评测基准,覆盖1651个PDF页面,包含10种文档类型、5种版面类型、5种语言。评测从四个维度打分:文字转录的准确度(用归一化编辑距离衡量,越低越好)、公式识别的准确度(用CDM衡量,越高越好)、表格重建的准确度(用TEDS和TEDS-S衡量,越高越好)以及阅读顺序的准确度(用编辑距离衡量,越低越好)。综合得分由文字分、公式分和表格TEDS三项平均得出。

在这个榜单上,OvisOCR2拿到了96.58的综合分,不仅是所有端到端方法里的第一名,还超越了此前领跑的流水线方法PaddleOCR-VL-1.6(96.33分)。具体来看每项指标:OvisOCR2的文字编辑距离是0.025,是所有模型中最低的;公式CDM是97.53,是所有模型中最高的;表格TEDS是94.76,与PaddleOCR-VL-1.6并列第一;表格TEDS-S是97.16,是所有模型中最高的;阅读顺序编辑距离是0.111,是所有模型中最低的。

作为参照,那些参数规模大得多的通用视觉语言模型表现如何?Qwen3-VL-235B(2350亿参数)综合分是89.78,Gemini 3 Pro综合分是92.91,Ovis2.6-30B-A3B(300亿参数)综合分是93.70。OvisOCR2用0.8B参数的规模,比这些巨型模型高出了3到7个百分点。

第二个战场是PureDocBench,这个评测基准的特点是数据来源可追溯——文档图片从HTML渲染生成,标注答案直接从同一HTML源提取,避免了人工标注误差。评测分三个轨道:清洁轨道(标准渲染图片)、数字轨道(有退化处理的图片)和真实轨道(手机拍照、复印件、截图等真实场景图片),涵盖1475个页面,共4425张图片,跨10个领域66个子类别。

OvisOCR2在Avg3(三轨道平均分)上达到75.06,是所有参评模型中最高的,同时在清洁轨道和数字轨道上也分别排名第一。在真实轨道上,OvisOCR2以66.56分排在Gemini-3.1-Pro(71.98分)和Qwen3.5-122B-A10B(69.85分)之后,说明在严重退化的真实照片场景下,针对文档解析专门优化的小模型在鲁棒性上仍有提升空间。这也是研究团队明确指出的未来工作方向之一。

第三个战场是内部评测集。公开榜单的数据分布未必能完全覆盖真实业务中的长尾场景,研究团队自建了一个超过1000页的内部基准,覆盖领域特定的表格、带公章的扫描报告、有手写批注的打印模板等更复杂的真实文档。在这个评测集上,OvisOCR2的综合分是85.54,高于PaddleOCR-VL-1.6的82.88、GLM-OCR的82.80、PaddleOCR-VL-1.5的81.55,以及MinerU2.5-Pro的65.54。按难度分层来看,在简单文档上OvisOCR2得87.95,中等难度文档上85.82,困难文档上78.99,在每个难度层级上都领先于所有竞争方法。

研究团队还专门针对两类特别棘手的场景做了子集分析。在手写文档子集上,OvisOCR2以72.28的综合分位居第一,特别在文字编辑距离(0.1561,最低)、公式CDM(81.51,最高)和阅读顺序编辑距离(0.1733,最低)上均领先,只有表格TEDS一项(50.95)略低于GLM-OCR的57.31。在复杂表格子集上,OvisOCR2综合分83.97,遥遥领先于第二名GLM-OCR的74.08,表格TEDS最高(78.34),文字编辑距离最低(0.1040),最关键的是表格丢失率仅7.96%——而流水线方法因为版面分析可能漏检表格,丢失率普遍在13%到17%之间。一旦版面分析把一个表格漏掉了,后续识别环节根本没有机会弥补这个错误,而端到端方法从整页理解出发,就不会有这种不可逆的"先天残缺"。

---

五、定性对比:肉眼能看出差距

除了定量数字,研究团队还在论文中展示了多组定性对比案例,直观说明不同模型的实际输出差异。

在一张包含Kubernetes集群架构设计文档的中文页面上,这张页面同时包含说明文字、多个表格和页眉页脚信息。OvisOCR2的输出完整地保留了所有内容,表格的行列结构完全正确。PaddleOCR-VL-1.6和MinerU2.5-Pro的输出在文字内容上基本过关,但表格中出现了个别识别错误(标红部分)。而Unlimited-OCR在这个页面上出现了严重的幻觉式重复输出,生成了大量与原文完全无关的内容,显然是模型在无法准确识别复杂页面时"乱说话"了。

在一张包含手写日记的中文页面上,OvisOCR2准确识别出了日期格式"DATE / 118 / 484"和所有手写正文内容。PaddleOCR-VL-1.6和MinerU2.5-Pro虽然总体方向正确,但存在若干字符识别错误(如"高涨"被识别为"高话","缘份"被识别为"微信")以及标点符号和句子边界的处理差异。在另一张手写歌词页面上,MinerU2.5-Pro出现了明显的阅读顺序错误——歌词原本是单栏从上到下排列,却被解析为两栏交叉阅读的顺序,导致输出内容逻辑混乱。OvisOCR2则正确按照从上到下的顺序输出了完整歌词。

---

六、规模与效率的平衡:为什么选0.8B?

整个项目的一个核心设计决策是:为什么目标是0.8B参数的小模型,而不是像很多竞品那样使用3B、4B甚至7B的模型?

研究团队给出的理由很务实。在实际部署中,模型越大,推理速度越慢,硬件成本越高,特别是在需要处理大量文档的企业场景中,0.8B的模型在同样的硬件上可以并行处理更多文档。但更关键的是,研究团队通过精心设计的数据引擎和训练方案,已经能让0.8B的模型在主流评测上超越参数量大得多的竞争对手,这说明在文档解析这个特定任务上,数据质量和训练策略的提升空间远没有被穷尽,而盲目堆砌参数并不是最优解。

当然,0.8B模型也有其局限:在面对极端退化的真实照片文档时,它的鲁棒性确实不如那些超大模型。这是大模型在视觉理解方面的先天优势,也是研究团队明确列为未来工作方向的问题。

---

说到底,OvisOCR2这个研究最值得关注的地方,不仅仅是一个具体的数字分数。更重要的是,它证明了端到端方法在文档解析这个任务上,已经有能力真正击败长期依赖多模型流水线组合的工程方案。用一个统一的小模型取代一套复杂的多模型系统,不仅让部署变得简单,还避免了流水线方案中各阶段错误相互叠加的宿命。

对于那些需要大规模处理文档的开发者和企业来说,这意味着基础设施可以大幅简化——不再需要维护版面分析、文字识别、公式识别、表格识别这几套独立的模型和工程管道,一个模型搞定全部。而对于普通用户而言,这类技术的持续进步意味着将来无论是处理工作报告、整理学习资料还是数字化老旧纸质档案,AI工具将变得更加可靠、更加普及。

当然,手写文字的识别以及经过严重拍照退化的文档处理,依然是这类小模型的薄弱环节。感兴趣深入了解技术细节的读者,可以通过arXiv编号2607.13639查阅完整论文,或者直接访问Hugging Face上ATH-MaaS/OvisOCR2页面体验开源模型。

---

Q&A

Q1:OvisOCR2和普通OCR软件有什么区别?

A:普通OCR软件通常只认识文字,无法处理表格结构、数学公式和阅读顺序等复杂元素。OvisOCR2是端到端文档解析模型,能同时处理文字、表格(保留行列结构)、数学公式(用LaTeX格式输出)以及图片位置,并按正确阅读顺序输出结构化Markdown文本,适合复杂文档的完整数字化处理。

Q2:端到端文档解析为什么比流水线方法更有优势?

A:流水线方法把文档解析拆成多个步骤:先检测版面,再逐区域识别,最后拼合。任何一步出错都会影响后续——比如版面检测漏掉一个表格,后面就没有机会弥补。端到端方法用单个模型直接从整张页面图片生成最终结果,不存在步骤间的误差叠加,部署也只需维护一个模型,复杂度大幅降低。

Q3:OvisOCR2在哪些文档类型上效果比较弱?

A:OvisOCR2在手机拍照、复印件、截图等严重退化的真实照片类文档上,效果弱于Gemini-3.1-Pro等超大型通用视觉模型。此外,手写文档的表格识别精度也略低于某些流水线方法。研究团队已明确将提升真实场景图像鲁棒性和手写内容处理能力列为下一步研究重点。