论文链接:
代码开源:
当OCR开始”看懂”图表:一场文档处理的范式革命
你是否有这样的经历——收到一份满是图表和公式的PDF学术论文,想让它变成可编辑的文字,结果传统OCR只能识别正文,图表全部变成了模糊的图片?或者从网上保存了一张信息图,想提取里面的数据却无从下手?
这些困扰了学术界和产业界多年的难题,如今有了突破性解决方案。
近日,华中科技大学与小红书hihlab联合发布了Multimodal OCR(MOCR)技术——一种全新的文档解析范式,能够将文档中的一切元素(文字、表格、图表、图标、公式、UI界面)统一解析为结构化输出。更令人惊叹的是,它不仅能识别图表,还能把图表**”翻译”成可执行的SVG代码**,实现真正的像素级重建。
图1:MOCR工作流程图——给定文档图像,MOCR将页面上的所有元素解析为统一、有序的文本表示,同时捕获文本和视觉结构
这项工作在多个权威基准测试中刷新了纪录:在olmOCR-Bench上达到83.9分(历史新高),在OCR Arena Elo排行榜上仅次于Gemini 3 Pro,在开源模型中稳居第一,并在图表转SVG任务上超越了Gemini 3 Pro。
而完成这一切的,是一个仅有30亿参数的紧凑模型。
1. 传统OCR的”盲区”:它们只看得懂文字
在深入了解MOCR之前,我们有必要先看清传统OCR系统的局限。
1.1 文本-centric的困局
在大型语言模型和多模模型蓬勃发展的今天,文档解析已经成为预训练和检索的核心数据引擎——它决定了我们能从海量的PDF、扫描件和截图中有多少可靠、结构化的监督信号可用。
然而,传统的文档解析系统有一个根本性的偏见:它们只关心文字。
当你把一份包含图表的PDF交给传统OCR时,它会:
-
识别出每一段文字 -
检测出表格的区域 -
但对于图表、流程图、图标、UI元素——对不起,直接裁剪成像素块完事
换句话说,传统OCR把非文字元素当作”不可描述的图像”,简单粗暴地保存为 raster crops(图块),然后丢弃。
图2:传统OCR与MOCR范式对比——传统OCR将图形当作像素处理并经常丢弃,而MOCR将图形解析为结构化代码(如SVG),实现忠实重建
这意味着什么?
大量的结构信息和语义信息被永远地丢失了。
一份年报中的柱状图,包含了关键的业务洞察数据——但传统OCR只能把它保存为一张模糊的图片,无法提取其中的数值、无法分析趋势、无法重新编辑。
一份化学分子结构图,蕴含着宝贵的科研数据——但传统OCR只能把它当作一张图片存档,无法将其转化为可计算的化学结构表示。
一份UI设计稿,包含了精确的布局和组件信息——但传统OCR只能把它变成一张截图,无法提取按钮位置、无法分析布局结构。
这不仅是信息丢失的问题,更是对监督信号的极大浪费。
1.2 被忽视的金矿
现代文档中的视觉元素——图表、图示、图标、UI组件、科学插图——实际上蕴含着极其丰富的信息。它们往往比纯文本更能直观传达复杂关系、趋势和结构。
然而,由于技术限制,这些”金矿”长期被忽视或低效利用。研究者们尝试过各种方案:有的专门做表格识别,有的做公式识别,有的做图表解析……但这些都是各自为战的独立系统,无法统一处理一份文档中的所有元素。
这正是MOCR要解决的核心问题:让OCR从”文字识别”升级为”文档理解”,把所有信息元素都作为第一类解析目标。
2. MOCR的核心思想:一切皆可解析
2.1 统一解析框架
MOCR的核心创新在于提出了一个统一的文档解析框架。与过去针对不同元素使用不同模型、不同流程的”级联管道”不同,MOCR用单一模型处理所有元素。
给定一张文档图像,MOCR生成一个有序的元素序列:
其中:
-
:元素的空间区域(边界框) -
:元素的语义类别(文本行、表格、公式、图表、图标……) -
:元素的内容载荷
关键在于的类型:
-
对于文本元素(文本行、段落、表格、公式),是对应的文字转录(纯文本、表格标记、LaTeX公式) -
对于视觉元素(图表、图标、UI组件),是可渲染的SVG代码
这就是MOCR的革命性之处:它把图表也”翻译”成了代码,而不是保存为像素图片。
2.2 为什么是SVG?
SVG(Scalable Vector Graphics)是一种基于XML的矢量图形格式。与像素图片不同,SVG代码可以直接描述图形元素的几何形状、位置、颜色、样式。
举个例子,一个柱状图:
-
传统OCR:保存为一张PNG/JPG图片 -
MOCR:生成类似这样的SVG代码
<svg viewBox="0 0 400 300">
<rect x="50" y="100" width="30" height="150" fill="#4285f4"/>
<rect x="100" y="150" width="30" height="100" fill="#4285f4"/>
<rect x="150" y="80" width="30" height="170" fill="#4285f4"/>
<!-- 轴线、标签等 -->
</svg>
这意味着什么?
可编辑:你可以修改SVG代码来调整图表的任何一个细节 可复用:同样的数据可以用不同的视觉风格重新渲染 可计算:程序可以直接解析SVG来分析图表的结构和数据 无损缩放:矢量格式不存在像素化问题
MOCR团队选择SVG作为目标格式,正是看中了它的表达力和可操作性。不过他们在论文中也指出,MOCR的范式并不局限于SVG——理论上可以是任何”可执行、可渲染”的表示,比如:
-
TikZ(科学图形) -
D3.js(交互式可视化) -
CAD格式(工程图) -
化学结构表示(如SMILES)
2.3 统一架构的设计
MOCR采用了经典的Vision-Language Model架构,但针对文档解析任务做了深度定制:
视觉编码器(Vision Encoder):
-
参数规模:12亿 -
从零开始训练(非预训练权重) -
输入分辨率:最高约1100万像素(~1.1M像素) -
为什么需要如此高的分辨率? -
文档页面往往包含密集的小字体 -
图表、图示中的细节(如坐标轴刻度、图例标记)需要精确感知 -
跨页面的长程空间关系需要保持
-
语言解码器(Language Decoder):
-
基础模型:Qwen2.5-1.5B -
选择1.5B参数的原因: -
太小:无法同时处理异构页面内容和生成长序列结构化输出 -
太大:训练和推理成本急剧上升 -
1.5B是在性能和成本之间的最佳平衡点
-
多模态连接器:
-
轻量级设计,负责视觉特征和语言空间的映射
整体模型参数约30亿,在消费级GPU上即可部署运行。
3. 训练策略:三阶段递进式学习
3.1 数据工程:难点与突破
训练一个”全能型”文档解析模型,数据是最大的挑战。
首先,文本标注相对容易获取——大量的PDF文档、结构化网页都可以自动生成文字标注。
但视觉元素的监督信号极为稀缺。现实文档几乎不会提供图表对应的程序化表示(SVG代码)。你不能简单地”下载”一批带SVG标注的图表数据。
其次,可渲染程序具有”非唯一性”——不同的代码可以渲染出完全一样的视觉效果。这意味着:
-
训练时需要标准化(canonicalization) -
质量控制非常困难 -
评估时需要”render-and-compare”
再者,任务要求精确的视觉定位 + 长序列结构化生成,难度远高于纯文本OCR。
为了解决这些问题,MOCR团队构建了一个综合性数据engine,包含四大数据源:
(1)PDF文档
-
使用dots.ocr作为自动标注引擎 -
通过分层采样确保语言、领域、布局复杂度的多样性 -
针对指令微调,进行规则检查和渲染验证,排除噪声
(2)网页渲染
-
爬取真实网页并渲染为图像 -
利用HTML/DOM结构作为对齐的监督信号 -
提供天然的SVG原生图标、图表、图示
(3)原生SVG资产
-
从各渠道收集真实SVG文件 -
清洗:去除无关元数据、标准化数值精度、去重(代码层面 + 图像感知哈希) -
采样:按领域平衡 + 按复杂度平衡
(4)通用数据
-
保持模型的基础视觉理解能力
3.2 三阶段训练配方
MOCR采用三阶段递进式训练,每阶段有明确的优化目标:
第一阶段:视觉-语言接口建立
-
通用视觉训练,建立稳定的视觉-语言对齐 -
让语言模型能够”读懂”视觉token
第二阶段:广义的预训练
-
混合通用视觉数据 + 纯文本文档解析监督 -
强化文本解析能力,同时保持通用视觉鲁棒性
第三阶段:MOCR专项强化
-
降低通用视觉数据比重 -
增加多模态文档解析(文本 + 图像转SVG) -
逐步提升输入分辨率,应对越来越难的页面解析和长结构化生成
整个过程中,始终保持单一的 autoregressive 目标函数,通过混合重加权和课程调度控制优化稳定性。
指令微调(SFT):
-
使用数据工程精选的高质量样本 -
针对SVG任务,进行专项处理:规范化、viewBox标准化、复杂度控制 -
释放两个checkpoint: -
dots.mocr:平衡版本 -
dots.mocr-svg:增加SVG权重,专门强化图像转SVG任务
-
4. 评估体系:超越传统指标的创新
4.1 传统指标的局限性
传统的OCR评估指标,如Word Error Rate(WER)、Normalized Edit Distance(NED),以及针对特定任务的TEDS(表格)、CDM(公式)等,存在明显问题:
-
依赖规则匹配:对表面形式过度敏感 -
无法评估结构保真度:无法判断”这份文档的解析结果是否忠实于原文档” -
对非唯一表示无能为力:比如SVG代码可以有N种写法
4.2 OCR Arena:LLM-as-a-Judge
MOCR团队提出了OCR Arena评估框架,用大模型来评估大模型。
核心思想:
-
使用Gemini 3 Flash作为”裁判” -
给定原文档图像 + 两个模型的输出,让裁判判断哪个更好 -
统计Elo分数
关键设计:消除位置偏见
为了避免”先出现的答案更容易被选中”的偏见,团队采用对称评估协议:
-
每次A vs B的对比,做两轮试验 -
轮次1:A在前,B在后 -
轮次2:B在前,A在后 -
只有两轮判断一致,才判定胜负
Elo rating系统:
-
借鉴国际象棋的评分机制 -
1000次bootstrap重采样确保统计稳定性
这种评估方式的优势:
-
不依赖表面字符串匹配,更接近人类感知 -
能够捕捉”错误严重程度”的差异 -
对结构化输出的评估更公平
5. 性能表现:全面屠榜
5.1 文档解析基准
在olmOCR-Bench、OmniDocBench v1.5、XDocParse三个权威基准上,dots.mocr的表现如下:
表2:Elo对比(Gemini 3 Flash担任裁判)
|
|
|
|
|
|
|---|---|---|---|---|
|
|
|
|
|
|
| dots.mocr | 1104.4 | 1059.0 | 1210.7 | 1124.7 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
关键结论:
-
在所有开源模型中排名第一 -
与Gemini 3 Pro(闭源顶级模型)的差距仅约86 Elo分 -
远超其他开源方案
表3:olmOCR-Bench分项得分
|
|
|
|
|---|---|---|
|
|
|
85.9 |
|
|
|
85.5 |
|
|
|
90.7 |
|
|
|
85.3 |
|
|
|
83.9 |
在olmOCR-Bench上,dots.mocr创下83.9分的新纪录,超越Infinity-Parser 7B、olmOCR v0.4.0等强劲对手。
5.2 图表解析:逆袭Gemini 3 Pro
图3:总体性能对比——(a)文档内图像解析任务;(b)通用文档解析任务
在图表转SVG的任务上,dots.mocr-svg展现了令人惊喜的统治力:
表4:ISVGEN重建分数(越高越好)
|
|
|
|
|
|
|
|
|---|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| dots.mocr-svg | 0.902 | 0.905 | 0.834 | 0.800 | 0.797 | 0.901 |
关键亮点:
-
在UniSVG整体分数上,领先OCRVerse 13.9个百分点 -
在ChartMimic、Design2Code、GenExam、SciGen、ChemDraw五个下游任务上全面超越Gemini 3 Pro -
尤其在结构敏感任务(化学结构、图表)上优势明显
5.3 通用VQA能力
虽然MOCR主攻文档解析,但在通用视觉问答任务上依然保持竞争力:
表5:通用VLM能力对比
|
|
|
|
|
|
|
|
|
|---|---|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| dots.mocr | 77.4 | 55.3 |
|
|
83.2 | 86.0 |
|
-
在CharXiv描述和推理上显著优于Qwen3-VL-4B(+1.2和+15.6分) -
在ChartQA上表现突出 -
在OCRBench上保持强劲
这说明:统一文档解析和视觉语言训练,并不会损害模型的一般能力。
6. 应用前景:超越解析的更大图景
6.1 预训练数据的”新金矿”
MOCR最深远的影响,可能不在于文档解析本身,而在于它为多模态预训练开辟了全新的数据来源。
核心逻辑:
过去的文档解析只能提取文本token。一份100页的PDF,解析后可能只有10KB的文本。
但MOCR可以同时输出:
-
文本token(和过去一样) -
SVG代码(过去被丢弃的图表信息) -
图像-SVG对(可用于图像到代码的对比学习)
也就是说:同样一份文档,现在可以提取出3-5倍的有效监督信号。
而且这些信号是可控的、可扰动的——你可以修改SVG代码的一个参数,生成”变体”,创造更多的训练数据。
论文中提到,MOCR的愿景是构建大规模image-to-code corpora(图像到代码语料库),用于多模态预训练。
6.2 更广泛的应用场景
除了预训练数据构建,MOCR的直接应用场景包括:
文档智能化处理:
-
合同审核:从扫描件中同时提取条款文字和表格、签章图像 -
学术文献管理:将论文中的图表也结构化,便于检索和分析 -
财务报告解析:同时提取文字描述和图表数据
UI/UX设计自动化:
-
设计稿转代码(Design2Code) -
界面元素提取和分析 -
跨平台UI迁移
知识图谱构建:
-
从文档中提取实体关系(文字 + 图表共同作为证据)
教育科技:
-
教科书解析:公式、图表、示意图全部结构化 -
智能答疑:基于结构化文档构建问答系统
7. 技术深挖:为什么MOCR能成功?
7.1 高分辨率视觉编码器
MOCR的视觉编码器有几点关键设计值得深入分析:
从零开始训练 vs 使用预训练权重(如CLIP、DINO):
论文选择从零训练一个12亿的视觉编码器,这是一个有意识的决策。
预训练视觉模型(如ViT)通常针对自然图像优化,它们的特征表示对于密集文本+几何图形的文档场景并非最优。
通过从零训练,编码器可以针对性地学习:
-
细粒度的字符识别 -
密集文本和几何元素的联合建模 -
跨字符、跨行的长程依赖
高分辨率策略:
1.1M像素的输入分辨率意味着:
-
一张A4纸大小的扫描件可以保持300 DPI以上的清晰度 -
图表中的小字、刻度、图例都能被准确感知 -
整个页面的空间关系得以完整保留
这对结构化输出至关重要——如果你在解析的第一步就丢失了位置信息,后续无论如何都无法准确重建文档结构。
7.2 图像转SVG的技术挑战
把图像”翻译”成SVG代码,是MOCR中最具挑战性的任务之一。论文中提到了几个核心难点:
非唯一性(Non-uniqueness):
-
同一个视觉输出可以由无数种SVG代码实现 -
这导致: -
训练时目标不唯一 -
评估时难以判断”正确性”
-
-
解决方案:canonicalization(规范化)+ render-based verification(基于渲染的验证)
渲染保真度:
-
模型生成的SVG必须能够忠实渲染原图像 -
需要处理:颜色近似、字体回退、路径精度等问题
复杂度控制:
-
SVG代码可以非常复杂(成千上万行) -
简单图形不应该被解析成过度复杂的代码 -
需要复杂度感知的采样和训练
论文透露,这些问题通过数据engine的精细设计和训练稳定化技术得到有效解决。
7.3 统一范式的优势
与过去”一个任务一个模型”的方案相比,MOCR的统一范式有几个优势:
知识迁移:
-
文档解析的视觉理解能力可以和图表解析相互促进 -
表格识别学到的结构建模能力,有助于理解图表的布局
端到端优化:
-
避免了级联系统的误差累积 -
整个 pipeline 可以联合优化
部署简洁:
-
一个模型替代过去5-10个专用模型 -
维护成本大幅降低
8. 局限性与未来工作
8.1 当前局限
论文坦诚地指出了当前版本的一些局限:
任务条件化:
-
当前版本需要任务指令来指定解析目标 -
尚未实现”一次输出同时包含完整文档解析和图表SVG”的单次前向传播
特定领域的gap:
-
在某些子任务上(如Headers & footers、Long tiny text),最佳分数由其他系统保持 -
说明仍有提升空间
SVG质量的边界:
-
对于复杂的自然照片(无法用简洁程序描述),仍保留为raster -
并非所有图形都能完美转SVG
8.2 未来方向
论文提到了几个有价值的探索方向:
更多程序空间:
-
TikZ(科学图形) -
D3.js(交互式可视化) -
CAD(工程图) -
SMILES(化学结构)
网页解析扩展:
-
当前已支持网页渲染 -
未来可以更深度地利用网页的DOM结构
自我改进的数据飞轮:
-
用模型自身来筛选和生成更高质量的训练数据 -
tighter render verification loops
更智能的评估:
-
论文提出的OCR Arena是一个重要创新 -
类似的judge-based评估协议可能成为结构化输出评估的标准方法
9. 行业启示:文档AI的新篇章
9.1 从”提取”到”理解”
MOCR代表了一种根本性的范式转变:
过去:OCR = 光学字符识别 → 把图片变成文字 未来:OCR = 文档理解 → 把文档变成结构化知识
这一转变的核心驱动力是视觉语言模型的成熟。当模型能够”看懂”图表、能够”推理”布局关系时,文档解析就不仅仅是”识别”,而是真正的”理解”。
9.2 开源的意义
值得注意的是,MOCR开源了代码和模型权重。
这意味着:
-
学术研究者可以基于它进行二次创新 -
产业界可以低成本地部署和应用 -
社区可以共同推动技术进步
在当前”闭源模型霸榜”的趋势下,开源工作更能推动整个领域的民主化。
9.3 多模态预训练的新范式
论文反复强调一个观点:文档是未被充分利用的多模态预训练数据源。
过去,我们只从文档中提取文本;现在,我们可以提取”文本 + 代码 + 图像-代码对”。
这可能开启一个数据 scale的新时代——同样数量的文档,可以产生3-5倍的有效训练数据。
10. 总结
MOCR是一项具有里程碑意义的工作。它重新定义了”文档解析”的边界:
-
从识别文字,到理解一切:文本、表格、公式、图表、图标、UI组件,都是第一类解析目标 -
从保存像素,到生成代码:图表被解析为可编辑、可计算、可复用的SVG代码 -
从单一任务,到统一框架:一个模型处理所有文档解析需求 -
从信息丢失,到信息回收:文档中的视觉元素不再是”不可描述的垃圾”,而是结构化的知识
性能表现同样亮眼:
-
在OCR Arena Elo排行榜上仅次于Gemini 3 Pro(开源第一) -
在olmOCR-Bench上创下83.9分的新纪录 -
在图表转SVG任务上全面超越Gemini 3 Pro -
全部在3B参数的紧凑模型上实现
这项工作来自华中科技大学(HUST)和小红书hihlab的联合团队,是高校与工业界协作的典范。
我们有理由相信,MOCR代表的是文档AI的未来方向——从text-centric OCR,走向document-native multimodal parsing。
看完不过瘾,那就自己发一篇吧!







![表情[nanguo]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/nanguo.gif)
![表情[haobang]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/haobang.gif)
![表情[shuai]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/shuai.gif)
![表情[deyi]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/deyi.gif)
![表情[chi]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/chi.gif)



暂无评论内容