这项由华中科技大学与金山办公软件联合开展的研究,以预印本论文的形式于2026年7月发布在arXiv平台,论文编号为arXiv:2607.11562。研究团队从根本上重新思考了一个问题:现有的AI视觉系统,真的适合用来"读文件"吗?

每天,无数张文件图片需要被计算机理解——合同、发票、学术论文、手写笔记、古籍文献……这些材料承载着人类知识的精华,但对于当前主流的AI视觉系统来说,读懂这些文件却是一件格外困难的事。问题不在于AI不够聪明,而在于AI的"眼睛"从一开始就没有为读文件而生。

以目前应用最广泛的视觉模型为例,CLIP、SAM、DINO这些系统都是在自然图像上训练出来的——它们学会了识别猫、汽车、树木,能分辨场景的整体语义,却对文字的细微差别极为迟钝。对它们来说,"1"、"l"、"I"这三个字符长得几乎一样,","和"。"的差异微乎其微,上标"?"和普通数字"2"更是毫无区别。可在真实文件中,这些细节往往决定了整个文句的含义。

正是为了解决这个核心矛盾,华中科技大学研究团队设计并推出了MonkeyOCRv2——一套专门为文件图像而生的视觉预训练编码器。与其说这是一次小的技术改良,不如说是从地基开始重建了AI阅读文件的方式。

一、为什么现有AI的"眼睛"不适合读文件

要理解这项研究解决的核心问题,可以把AI视觉系统比作一双人类的眼睛。日常生活中,我们看风景的眼睛和校对文稿的眼睛其实处于完全不同的工作状态——看风景时,你关注的是色彩、构图、物体的整体形态;校对文稿时,你的眼睛要逐字逐句扫描,对每一个笔画都保持高度警惕。现有的主流AI视觉模型,就像是一双只会看风景的眼睛,被强行要求去校对文稿。

具体来说,CLIP这类视觉-语言预训练模型学习的是"图像整体与文字描述之间的对应关系",比如一张森林图配上"绿色的森林"这段描述。这种训练方式让模型擅长理解图像的宏观语义,却让它对局部细节天然迟钝——因为森林图里哪棵树的形状发生变化,几乎不影响整体的语义理解。DINO系列模型通过自监督学习到了稳定的语义特征,在不同视角下保持一致,这种特性对自然图像任务极为有用,但放在文档场景下,"不同视角下保持一致"恰恰是个问题——文件里的每个字符都必须被精确区分,容不得任何模糊。SAM则专注于分割图像中的区域边界,擅长的是"这块区域属于哪个物体",而不是"这个字是什么字"。

文件图像的特殊性在于,它的语义完全依赖于极其细微的局部视觉信息。一个小数点的位置差几个像素,数字就从一百万变成了一千万;一个字的笔画多一横少一横,意思可能天差地别;超脚标"α?"和普通字母"α1"的视觉差异极小,但数学含义截然不同。这些需求,超出了所有现有通用视觉模型的能力边界。

更麻烦的是,现有专门针对文档场景的预训练模型同样有明显局限。oCLIP主要在场景文字图像上训练,数据规模只有45万张;DiG虽然用了3560万张图,但几乎全是场景文字,文档类型极为单一;DiT用了4200万张扫描文档,但缺乏精细的文字标注;Donut覆盖了4种语言,大约1300万张图;Pix2Struct处理的是网页截图,覆盖8000万张但只有英文。这些模型要么规模小,要么类型单一,要么语言覆盖不足,没有一个真正做到全面、多语种、高质量。

MonkeyOCRv2就是在这样的背景下诞生的——它的目标,是打造一双真正适合读文件的"眼睛"。

二、史上最大文档图像预训练数据集:MonkeyDoc v2的诞生

要让AI学会读文件,首先得给它足够多样、足够高质量的"练习材料"。研究团队花费了大量精力构建了一个名为MonkeyDoc v2的超大规模数据集,据研究团队所知,这是目前针对文档图像视觉预训练规模最大的语料库。

这个数据集包含了1.13亿张图像,覆盖17种语言,分别是简体中文、繁体中文、英语、阿拉伯语、德语、西班牙语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、俄语、泰语和越南语。语言数量之多、覆盖范围之广,在文档预训练领域前所未有。

从数据类型来看,MonkeyDoc v2涵盖了几乎所有你能想到的文档形态:学术论文、招标文件、书籍、考试试卷、财务报告、政府文件、杂志、说明书、报纸、笔记、海报、幻灯片、场景文字、教材、课本。1.13亿张图像中,800万张是页面级别的完整文档图像,另外1.05亿张是从页面中裁剪出来的细粒度元素——文字块、表格、公式、图注等。真实采集和合成生成的样本各占约一半,真实样本约6100万张,合成样本约5200万张。

为了保证数据质量,研究团队设计了一套精密的数据处理流程。在标注环节,他们没有依赖单一模型,而是采用了"多专家投票"的方式:对每一个裁剪出来的文档元素,让多个不同架构、不同训练数据的专业识别模型独立识别,然后计算它们之间的相互吻合程度,选取与其他模型结果最一致的那个答案作为最终标注。这种方法能有效压制单个模型的特定错误,提升标注可靠性。

在合成数据方面,团队从17种语言的大型语言模型训练语料库中随机采样文本,使用不同字体、样式、分辨率渲染成文档图像,还专门提取了每种语言的完整字符集,生成随机字符组合来覆盖罕见字符和低频符号。表格数据方面,他们把多语言文本填入真实表格模板和自动生成的表格结构中,学习各种复杂的布局和跨行跨列关系。公式数据方面,从arXiv爬取了大量论文公式,渲染成图文对,共约80万个公式样本。

数据筛选同样下了功夫。对于报纸、手写笔记这类难度高、容易标注出错的来源,团队设计了两道过滤机制:第一道检查版面标注的完整性——把所有检测到的区域用白块遮住,如果模型还能从被遮住的图像中识别出文字,说明有区域被漏检了,这类样本直接丢弃;第二道检查阅读顺序的逻辑性——把按照标注顺序拼接起来的文字交给大语言模型判断,看语义是否连贯,不连贯的也丢弃。经过这两道过滤,原本约120万页的挑战性文档最终保留了约90万页。

三、MonkeyOCRv2的双重训练目标:让眼睛既能"读"也能"看"

数据有了,接下来是训练方式。MonkeyOCRv2的核心创新在于提出了一种"双目标联合训练"的策略,这个设计背后的逻辑,用一个比喻来理解再直观不过。

一个优秀的书法鉴定师,他的能力来自两个方面:一方面,他能准确说出每幅字帖上写的是什么内容(这叫"读");另一方面,他对每个笔画的走势、每个字的结构、墨迹的浓淡都有极敏锐的感知(这叫"看")。只会"读"的鉴定师,可能在字迹模糊时靠猜文义来弥补;只会"看"的鉴定师,可能在面对陌生字体时无从判断含义。真正高水平的鉴定师,两者兼备,相互弥补。

MonkeyOCRv2的训练就遵循这个逻辑,同时优化两个目标。第一个目标叫做"图像到文本生成"——给模型一张文档图像,让它自动回答出图像里的文字内容是什么。这个目标直接对齐了视觉特征和文本内容,给模型提供密集的语义监督。第二个目标叫做"像素级文档重建"——给模型一张文档图像,让它不仅理解内容,还要能把原图精确地重建出来。这个目标逼迫编码器必须在内部表征中保留每一个笔画的形状、每一个字形的细节、整个页面的布局结构。

在技术实现上,整个训练框架由三个部分组成:视觉编码器(MonkeyOCRv2的核心,负责提取图像特征)、视觉解码器(负责从特征重建图像)和文本解码器(负责从特征生成文字)。图像进入编码器后,产生一组视觉特征;这组特征同时被送入视觉解码器(重建图像)和文本解码器(生成文字),两个解码器各自产生损失,加权求和后驱动编码器的学习。

重建损失的计算方式也经过了精心设计。最基础的版本是均方误差——直接比较重建图像和原图每个像素的差距。但为了更好地保留字符的笔画结构,研究团队还设计了一种"结构感知重建损失",额外比较图像的边缘图(用Sobel算子计算的梯度幅值)和"距离到边缘的图"(通过迭代最小池化计算),让模型不仅关注像素值本身,还关注笔画的轮廓和边界。

两个训练目标的总损失用一个权重参数λ平衡,默认取值1.0,即文本生成损失和重建损失等权重相加。结构感知重建损失中,边缘损失和距离损失的权重β取0.25,结构损失相对于像素损失的权重α取0.5。

研究团队训练了三个不同规模的编码器变体。以ViT-Small为基础的MonkeyOCRv2-S拥有2800万参数,以ViT-Base为基础的MonkeyOCRv2-B拥有1.13亿参数,以ViTAEv2-Small为基础的MonkeyOCRv2-AS拥有2100万参数。第三个变体使用了一种具有多尺度归纳偏置的网络结构,特别适合文字检测、图像分割等需要多分辨率特征的任务。所有三个变体都从零开始训练,使用完全相同的双目标训练方案和相同的MonkeyDoc v2数据集。训练在64块英伟达A800显卡上进行,峰值学习率设为0.001,全局批量大小256,采用动态分辨率训练策略——视觉token的数量根据输入图像分辨率自适应确定。

四、在文字识别上的突破:让老模型焕发新生

评价一个视觉编码器的质量,最直接的方式是把它"装进"各种下游任务模型,看性能是否提升。研究团队首先在文字识别任务上做了这个测试。

文字识别的核心目标是:给定一张图像,识别出里面的文字是什么。研究团队选择了两个有代表性的模型来做测试:CRNN(一个经典的、相对简单的识别架构)和PARSeq(当前领先的识别模型)。他们只做了一件事:把两个模型原来的视觉编码器替换成MonkeyOCRv2-S,其他所有部分保持不变。

测试结果相当惊人。在覆盖七类挑战性英文文字的Union14M基准测试上,换了MonkeyOCRv2-S编码器的CRNN平均准确率从49.2%飙升到65.2%,绝对提升16.0个百分点。对于原本已经非常强的PARSeq来说,也有3.3个百分点的提升,达到87.6%,超越了此前最强的SVTRv2(86.1%)。

在涵盖四类场景的中文基准测试上,CRNN整体平均提升了5.4个百分点,PARSeq提升了1.3个百分点。在专门测试被遮挡场景文字的基准上,CRNN提升了4.4个百分点,PARSeq提升了1.6个百分点。综合三个基准的平均表现,配备MonkeyOCRv2-S的PARSeq成为了当前综合表现最好的文字识别系统。

在六个更传统的常规基准测试(IIIT5K、SVT、IC13、IC15、SVTP、CUTE80)上,由于这些测试本身已经接近饱和(各系统准确率都超过95%),提升幅度相对有限,但依然存在:CRNN平均提升2.3个百分点,PARSeq平均提升0.4个百分点,后者超越了此前排名第一的SVTRv2。

五、公式识别:用小模型打败大模型

数学公式的识别是一个比普通文字识别更有挑战性的任务,因为公式涉及复杂的空间关系——上下标、分子分母、根号内的嵌套结构——每一层关系都需要精确捕捉。研究团队在这个任务上复现了一个更戏剧性的结果。

他们使用的基线模型是UniMERNet-T,一个以Swin Transformer为编码器、参数量约1.07亿的公式识别模型。UniMERNet系列中还有更大的版本:UniMERNet-S(2.02亿参数)和UniMERNet-B(3.25亿参数)。研究团队的做法很简单:把UniMERNet-T的Swin Transformer编码器替换成MonkeyOCRv2-S,其他所有部分(MBart解码器、训练数据、优化设置)完全不变,只需要加一个线性投影层把特征维度从384转换到512以匹配解码器。

替换之后,整个模型的参数量从1.07亿增加到1.10亿,几乎没有变化。但性能表现却发生了根本性的改变——换了编码器的UniMERNet-T,在几乎所有测试集上都超越了原本参数量是它三倍的UniMERNet-B。

在来自真实PDF文档的OmniDocBench 1.6测试上,表达式完全匹配率(ExpRate)提升了3.9个百分点。在测试手写公式的MathWriting基准上,完全匹配率提升了3.3个百分点,另一个评估指标CDM提升了5.2个百分点。在官方UniMER-Test的四个子集上,提升尤为突出:复杂印刷表达式子集的完全匹配率提升9.3个百分点,手写表达式子集提升7.6个百分点。一个参数量1.10亿的小模型全面超越了3.25亿参数的大模型,充分说明了编码器质量的决定性作用。

六、文字检测:连专门为检测而训练的竞争者都输了

文字检测的任务是在图像中找到文字的位置,画出包含它的框或区域。这个任务需要模型能处理不同大小、不同方向、不同形状的文字,因此格外需要能捕捉多尺度特征的编码器。研究团队为此专门使用了MonkeyOCRv2-AS(基于ViTAEv2的多尺度版本)。

测试覆盖了四个主流场景文字检测基准:ICDAR 2015(多方向文字)、ArT(任意形状文字)、Total-Text(曲线文字)和CTW1500(多种复杂场景文字)。研究团队在三种检测框架上做了对比:DBNet(经典分割式检测器)、PSENet(渐进尺度扩展检测器)和DPText-DETR(基于Transformer的先进检测器)。对照组除了MonkeyOCRv2-AS之外,还包括在ImageNet上预训练的原始编码器,以及oCLIP——一个专门为场景文字检测预训练的视觉编码器。

结果显示,MonkeyOCRv2在所有数据集、所有检测框架上都实现了稳定提升,且优于oCLIP。在ICDAR 2015上,DBNet的F值从85.0提升到88.5,比oCLIP还高1.1个百分点。在ArT任意形状文字数据集上,DPText-DETR的F值提升了3.1个百分点,而oCLIP在这个先进检测框架上甚至没有带来提升。在Total-Text曲线文字数据集上,DBNet提升3.3个百分点,DPText-DETR提升2.7个百分点(而oCLIP对DPText-DETR同样无效)。在CTW1500上,PSENet提升3.7个百分点,DPText-DETR提升3.2个百分点。

一个专门为场景文字预训练的编码器,在现代检测器上反而不如MonkeyOCRv2这个通用文档编码器,这个结果颇为耐人寻味,说明MonkeyOCRv2学到的文档视觉表征具有更广泛的迁移能力。

七、重叠文字分割和文档篡改检测:精细感知的两个极端

重叠文字分割是一项极具挑战性的精细任务:当两层文字叠加在一起时,系统需要分辨出哪些像素属于遮挡层文字、哪些属于被遮挡层文字、哪些是两者重叠的区域,并为每个区域生成精确的像素级掩码。研究团队把MonkeyOCRv2-AS分别装进了Mask2Former(通用图像分割框架)和MOTS(专门为重叠文字设计的系统)中进行测试。

在包含中英文重叠文字的MOT数据集上,Mask2Former配备MonkeyOCRv2-AS后,综合IoU指标(三类区域的平均交并比)从70.3%提升到76.6%,绝对提升6.3个百分点。MOTS配备MonkeyOCRv2-AS后,从72.6%提升到76.9%,提升4.3个百分点。在所有对比方法中,两者都达到了当前最好的性能水平。

文档篡改检测则是另一个方向的精细任务:给定一张文档图像,找出哪里的内容被人为修改过。这需要模型对极其微小的视觉不一致非常敏感,因为熟练的篡改者往往会尽量让修改痕迹难以察觉。研究团队在FFDN(Frequency Feature Decomposition Network)框架上进行了测试,对比了两种编码器:由DeepSolo预训练的ViTAEv2-S,以及MonkeyOCRv2-AS。

在DocTamper基准的三个测试集上,MonkeyOCRv2-AS均超越了对比编码器。在标准测试集DocTamper-Test上,F1值达到93.3%,比使用DeepSolo预训练编码器的基线高11.3个百分点。在跨域测试集DocTamper-FCD(字体和格式完全不同的文档)上,F1值88.9%,同样是所有方法中最高的。在更难的跨域测试集DocTamper-SCD(场景和风格差异极大)上,F1值80.4%,同样领先。这个结果表明,MonkeyOCRv2提供的文档视觉表征不仅对可见的篡改痕迹更敏感,跨域泛化能力也更强。

八、文档解析:0.7B的小模型超越3B的巨无霸

文档解析是一个更高层次的任务——不只是识别单个文字或定位文字区域,而是把整张文档图像转化成结构化的信息输出,包括文字内容、表格结构、公式内容、阅读顺序等一整套结果。研究团队在这里验证了一个更大胆的想法:如果把MonkeyOCRv2冻结(不更新它的参数),只搭配一个轻量级语言模型,能做到什么水平?

他们构建的系统叫做MonkeyOCRv2-Parsing,由三个部件串联而成:冻结的MonkeyOCRv2视觉编码器、一个MLP投影层(将视觉特征映射到语言模型需要的维度)、以及Qwen3-0.6B这个轻量级语言模型。MonkeyOCRv2-S版本(编码器3000万参数)的总参数量约0.6B,MonkeyOCRv2-B版本(编码器1.13亿参数)的总参数量约0.7B。

系统的工作流程分为两步:首先,把整张文档页面输入系统,让它预测文档中各元素的坐标位置、类别和阅读顺序;然后,按照预测的边界框把每个元素单独裁剪出来,分别送回系统识别具体内容;最后,按照预测的阅读顺序把所有识别结果组装成结构化输出。

训练也分两个阶段:第一阶段只训练MLP投影层,学习视觉和语言之间的对齐;第二阶段联合训练MLP和语言模型,视觉编码器全程冻结。在64块A800显卡上训练大约6到7天完成一个epoch。

在MDPBench(多语言文档解析基准,覆盖数字原生和拍照文档,跨17种语言)上,MonkeyOCRv2-B-Parsing以83.3分成为所有开源模型中的最高分,超越此前最好的开源系统dots.mocr(3B参数,得分80.5分)2.8个百分点。与此同时,MonkeyOCRv2-B-Parsing的视觉编码器参数量只有1.13亿,约为dots.mocr视觉编码器(1.2B)的1/11。比PaddleOCR-VL-1.6(0.9B,得分75.0分)高8.3个百分点,而后者的视觉编码器约是MonkeyOCRv2-B的5倍大。

在另一个重要基准OmniDocBench 1.6上,MonkeyOCRv2-B-Parsing综合得分91.57分,超越了多个规模远大于它的通用大模型:Qwen3-VL-235B(2350亿参数)得分89.78,GPT-5.2得分86.59,InternVL3.5-241B得分83.76,Kimi K2.5得分84.53。当然,它与专门经过大量后训练优化的顶级文档解析系统(如PaddleOCR-VL-1.6的96.33分、MinerU2.5-pro的95.75分)还有差距,但考虑到MonkeyOCRv2-Parsing没有进行任何任务专属的后训练优化,视觉编码器也保持冻结,这个成绩已经相当可观。

九、文档理解:让"视觉问答"的答案更精准

文档理解任务(Document VQA)是这样一种场景:给定一张文档图像,回答关于这张图像内容的自然语言问题,比如"合同编号是多少"、"图表中最高的柱子代表哪一年"。这种任务高度依赖对图像中文字的精确识别。

研究团队设计了一个极为严格的控制对比实验:把八种不同的视觉编码器分别与同一个语言模型(Qwen3-1.7B)通过同一个MLP投影层连接,使用完全相同的训练数据、完全相同的优化设置、完全相同的解码策略,只有视觉编码器不同,其他一切都锁定不变。视觉编码器也全部冻结,仅凭预训练表征质量决胜负。

测试覆盖了八个主流文档理解基准:DocVQA、InfoVQA、DeepForm、KLC、WTQ、ChartQA、DT-VQA、OCRBench。结果一目了然。使用MonkeyOCRv2-B的系统平均得分57.2,使用MonkeyOCRv2-S的系统平均得分55.9,两者是所有对比编码器中最高的。

其他编码器的对比成绩如下:OpenVision-B(采用对比学习加生成监督联合训练)得44.0;RADIOv2.5-B(多教师知识蒸馏)得37.5;SigLIP 2-B得24.9;SAM-B得25.2;DINOv3-B得16.1;CLIP-B得16.0;oCLIP得12.4;DiT仅得8.9。MonkeyOCRv2-B以13.2个百分点的优势超越OpenVision-B,以19.7个百分点的优势超越RADIOv2.5-B。

研究团队还通过消融实验逐步验证了每个训练目标的贡献:仅用文本生成训练(Baseline,无重建损失)的MonkeyOCRv2-S得50.7;加入像素级均方误差重建损失后提升到51.7,提升1.0个百分点;进一步加入边缘感知和距离感知结构重建损失后提升到55.9,再提升4.2个百分点。这说明重建损失,尤其是结构感知的重建损失,对于帮助编码器保留细粒度视觉信息有显著作用。

十、"做做假"就能发现的秘密:重建目标让AI不再依赖猜字

研究团队还设计了一个颇具创意的实验来验证重建目标的实际效果。这个实验的核心思路是:如果一个系统真的能精确感知字符的视觉形状,那么即使给它看一段把字符顺序随机打乱的"乱码文字",它也应该能正确识别每个字符;反之,如果系统主要依靠语言经验来猜测文字,那么当语言线索被破坏后,性能就会急剧下滑。

研究团队准备了两种测试样本:一种是正常语序的语义连贯文字,另一种是把字符顺序随机打乱的乱码文字(乱码后,语言上下文基本被破坏,但每个字符的视觉外观不变)。然后把输入图像的分辨率从高(长边1288像素)逐步降低到低(长边448像素),观察各个系统的表现如何变化。

结果揭示了一个令人警醒的现象。对于PaddleOCR-VL-1.5,随着分辨率从1288降到448,乱码文字识别率下降了38.5个百分点;对于dots.mocr,下降了56.8个百分点;对于Qwen2.5-VL-3B,下降了51.8个百分点。同时,语义连贯文字识别率和乱码文字识别率之间的差距随着分辨率降低而急剧扩大——在1288分辨率下PaddleOCR-VL-1.5的差距只有3.6个百分点,但在448分辨率下这个差距扩大到31.0个百分点。差距的扩大意味着,当视觉信号变弱时,系统越来越依赖语言经验来"猜"——这是一种认知上的捷径,但在真实文件识别中是个危险的习惯。

MonkeyOCRv2-S-Parsing相比之下更为稳健。没有重建目标的版本,分辨率从1288降到448时乱码识别率下降了44.3个百分点;加上重建目标后,只下降了27.6个百分点。对应地,语义-乱码差距在448分辨率下从29.3个百分点收窄到15.3个百分点。这说明,像素级重建目标确实在训练过程中迫使编码器保留了更完整的视觉信息,从而在语言上下文被破坏时依然能依靠视觉本身来识别字符。

研究团队还在CHAOS-Bench(文档幻觉评估基准,测试模型在视觉证据与语言先验冲突时能否忠实于视觉)上做了评测。这个基准通过在文档中修改2-3个选定词语的某个字符(让它变成视觉上可辨别但语义上无意义的词),测量模型能否正确输出这些被修改的词。MonkeyOCRv2-B-Parsing的页面平均召回率17.9%,是所有对比模型中最高的,比HunyuanOCR-1.5高3.7个百分点,比PaddleOCR-VL-1.6高11.9个百分点。使用有重建目标的MonkeyOCRv2-S编码器比无重建目标的基线高2.6个百分点。这再次印证了重建目标能减少视觉编码器对语言先验的过度依赖。

十一、这项研究还没做到的事

研究团队在文章中对几个尚待解决的问题保持了坦诚。MonkeyOCRv2-Parsing采用了相对简单的监督微调流程,视觉编码器全程冻结,没有使用领先专业解析器所用的渐进后训练策略;在已经比较饱和的OmniDocBench上,与最顶尖的专业文档解析系统仍有差距,原因之一正在于此。系统的解析架构是顺序执行的——先自回归预测版面,再对每个元素单独识别——这种设计有利于准确性,但不利于速度,对于需要快速响应的场景是个瓶颈。此外,虽然MonkeyDoc v2覆盖了17种语言,但各语言的数据量分布并不均匀,英文和中文合计占比最大,阿拉伯语、越南语等低资源语言的样本相对稀少,在这些语言上的表现还有提升空间。至于重建损失的具体权重设置、解码器设计对性能的独立贡献,目前还没有做系统性研究,这些都是留给未来工作的方向。

归根结底,这项研究传达的信息是:文档图像有其独特的视觉统计特性,这种特性与自然图像的差异如此深刻,以至于一个从零开始、专门为文档而生的编码器,即使规模较小,也能在广泛的文档任务上系统性地超越在自然图像上训练的通用巨头。MonkeyOCRv2以2800万到1.13亿参数的紧凑体量,在七个不同的文档分析任务上实现了一致的性能提升,其中包括文字识别、公式识别、文字检测、文档篡改检测、重叠文字分割、多语言文档解析和文档理解。用一句话概括:文档AI领域或许真的需要一个专属的视觉基础,而不只是把自然图像的技术挪过来凑合用。有兴趣进一步了解完整技术细节的读者,可以通过arXiv:2607.11562查阅原论文,代码和数据集也将在GitHub上公开发布。

Q&A

Q1:MonkeyOCRv2和CLIP、SAM这些视觉模型有什么本质区别?

A:CLIP、SAM等模型是在自然图像上训练的,擅长识别物体、场景等宏观语义,对细微字符差异不敏感。MonkeyOCRv2则是专门在1.13亿张文档图像上训练的,通过同时学习"识别文字内容"和"像素级重建图像"两个目标,迫使编码器保留每个笔画、字形和布局的精细细节,这正是读懂文件所必须具备的能力。

Q2:MonkeyDoc v2数据集为什么比其他文档数据集更有价值?

A:MonkeyDoc v2包含1.13亿张图像,覆盖17种语言和几乎所有文档类型,包括学术论文、财务报告、手写笔记、报纸等,是目前已知规模最大的文档视觉预训练数据集。相比之下,现有数据集要么规模小,要么语言单一,要么文档类型有限。此外,MonkeyDoc v2采用多专家投票标注和两道质量过滤机制,数据质量也有保障。

Q3:MonkeyOCRv2-Parsing怎么做到用0.7B参数超越3B模型的?

A:关键在于视觉编码器的质量。MonkeyOCRv2的编码器经过文档专属预训练,提取的视觉特征对字符细节和文档结构更敏感,即使冻结不更新,也能为后续语言模型提供高质量的视觉输入。相比之下,参数量更大的竞争模型如果使用质量较低的通用编码器,语言模型再大也无法弥补视觉感知上的先天不足。