华中科大与小红书hihlab强强联手:MOCR开启文档解析的”万能模式”,把图表转成代码,刷新OCR性能纪录!

华中科大与小红书hihlab强强联手:MOCR开启文档解析的”万能模式”,把图表转成代码,刷新OCR性能纪录!

华中科大与小红书hihlab强强联手:MOCR开启文档解析的
华中科大与小红书hihlab强强联手:MOCR开启文档解析的”万能模式”,把图表转成代码,刷新OCR性能纪录!
此内容为付费阅读,请付费后查看
5
立即购买
您当前未登录!建议登陆后购买,可保存购买订单
seekresource@163.com
1919588043
QQ1919588043
寻找资源网
微信小店:寻网百货
付费阅读
商城已上线,快去看看吧!

论文链接:

代码开源:

当OCR开始”看懂”图表:一场文档处理的范式革命

你是否有这样的经历——收到一份满是图表和公式的PDF学术论文,想让它变成可编辑的文字,结果传统OCR只能识别正文,图表全部变成了模糊的图片?或者从网上保存了一张信息图,想提取里面的数据却无从下手?

这些困扰了学术界和产业界多年的难题,如今有了突破性解决方案。

近日,华中科技大学与小红书hihlab联合发布了Multimodal OCR(MOCR)技术——一种全新的文档解析范式,能够将文档中的一切元素(文字、表格、图表、图标、公式、UI界面)统一解析为结构化输出。更令人惊叹的是,它不仅能识别图表,还能把图表**”翻译”成可执行的SVG代码**,实现真正的像素级重建。

图1图1:MOCR工作流程图——给定文档图像,MOCR将页面上的所有元素解析为统一、有序的文本表示,同时捕获文本和视觉结构

这项工作在多个权威基准测试中刷新了纪录:在olmOCR-Bench上达到83.9分(历史新高),在OCR Arena Elo排行榜上仅次于Gemini 3 Pro,在开源模型中稳居第一,并在图表转SVG任务上超越了Gemini 3 Pro

而完成这一切的,是一个仅有30亿参数的紧凑模型。

1. 传统OCR的”盲区”:它们只看得懂文字

在深入了解MOCR之前,我们有必要先看清传统OCR系统的局限。

1.1 文本-centric的困局

在大型语言模型和多模模型蓬勃发展的今天,文档解析已经成为预训练和检索的核心数据引擎——它决定了我们能从海量的PDF、扫描件和截图中有多少可靠、结构化的监督信号可用。

然而,传统的文档解析系统有一个根本性的偏见:它们只关心文字

当你把一份包含图表的PDF交给传统OCR时,它会:

  • 识别出每一段文字
  • 检测出表格的区域
  • 但对于图表、流程图、图标、UI元素——对不起,直接裁剪成像素块完事

换句话说,传统OCR把非文字元素当作”不可描述的图像”,简单粗暴地保存为 raster crops(图块),然后丢弃。

图2图2:传统OCR与MOCR范式对比——传统OCR将图形当作像素处理并经常丢弃,而MOCR将图形解析为结构化代码(如SVG),实现忠实重建

这意味着什么?

大量的结构信息和语义信息被永远地丢失了。

一份年报中的柱状图,包含了关键的业务洞察数据——但传统OCR只能把它保存为一张模糊的图片,无法提取其中的数值、无法分析趋势、无法重新编辑。

一份化学分子结构图,蕴含着宝贵的科研数据——但传统OCR只能把它当作一张图片存档,无法将其转化为可计算的化学结构表示。

一份UI设计稿,包含了精确的布局和组件信息——但传统OCR只能把它变成一张截图,无法提取按钮位置、无法分析布局结构。

这不仅是信息丢失的问题,更是对监督信号的极大浪费。

1.2 被忽视的金矿

现代文档中的视觉元素——图表、图示、图标、UI组件、科学插图——实际上蕴含着极其丰富的信息。它们往往比纯文本更能直观传达复杂关系、趋势和结构。

然而,由于技术限制,这些”金矿”长期被忽视或低效利用。研究者们尝试过各种方案:有的专门做表格识别,有的做公式识别,有的做图表解析……但这些都是各自为战的独立系统,无法统一处理一份文档中的所有元素。

这正是MOCR要解决的核心问题:让OCR从”文字识别”升级为”文档理解”,把所有信息元素都作为第一类解析目标。

2. MOCR的核心思想:一切皆可解析

2.1 统一解析框架

MOCR的核心创新在于提出了一个统一的文档解析框架。与过去针对不同元素使用不同模型、不同流程的”级联管道”不同,MOCR用单一模型处理所有元素。

给定一张文档图像,MOCR生成一个有序的元素序列:

图片[3]-华中科大与小红书hihlab强强联手:MOCR开启文档解析的”万能模式”,把图表转成代码,刷新OCR性能纪录!-寻找资源网

其中:

  • :元素的空间区域(边界框)
  • :元素的语义类别(文本行、表格、公式、图表、图标……)
  • :元素的内容载荷

关键在于的类型:

  • 对于文本元素(文本行、段落、表格、公式),是对应的文字转录(纯文本、表格标记、LaTeX公式)
  • 对于视觉元素(图表、图标、UI组件),是可渲染的SVG代码

这就是MOCR的革命性之处:它把图表也”翻译”成了代码,而不是保存为像素图片。

2.2 为什么是SVG?

SVG(Scalable Vector Graphics)是一种基于XML的矢量图形格式。与像素图片不同,SVG代码可以直接描述图形元素的几何形状、位置、颜色、样式

举个例子,一个柱状图:

  • 传统OCR:保存为一张PNG/JPG图片
  • MOCR:生成类似这样的SVG代码
<svg viewBox="0 0 400 300">
  <rect x="50" y="100" width="30" height="150" fill="#4285f4"/>
  <rect x="100" y="150" width="30" height="100" fill="#4285f4"/>
  <rect x="150" y="80" width="30" height="170" fill="#4285f4"/>
  <!-- 轴线、标签等 -->
</svg>

这意味着什么?

可编辑:你可以修改SVG代码来调整图表的任何一个细节 可复用:同样的数据可以用不同的视觉风格重新渲染 可计算:程序可以直接解析SVG来分析图表的结构和数据 无损缩放:矢量格式不存在像素化问题

MOCR团队选择SVG作为目标格式,正是看中了它的表达力可操作性。不过他们在论文中也指出,MOCR的范式并不局限于SVG——理论上可以是任何”可执行、可渲染”的表示,比如:

  • TikZ(科学图形)
  • D3.js(交互式可视化)
  • CAD格式(工程图)
  • 化学结构表示(如SMILES)

2.3 统一架构的设计

MOCR采用了经典的Vision-Language Model架构,但针对文档解析任务做了深度定制:

视觉编码器(Vision Encoder)

  • 参数规模:12亿
  • 零开始训练(非预训练权重)
  • 输入分辨率:最高约1100万像素(~1.1M像素)
  • 为什么需要如此高的分辨率?
    • 文档页面往往包含密集的小字体
    • 图表、图示中的细节(如坐标轴刻度、图例标记)需要精确感知
    • 跨页面的长程空间关系需要保持

语言解码器(Language Decoder)

  • 基础模型:Qwen2.5-1.5B
  • 选择1.5B参数的原因:
    • 太小:无法同时处理异构页面内容和生成长序列结构化输出
    • 太大:训练和推理成本急剧上升
    • 1.5B是在性能和成本之间的最佳平衡点

多模态连接器

  • 轻量级设计,负责视觉特征和语言空间的映射

整体模型参数约30亿,在消费级GPU上即可部署运行。

3. 训练策略:三阶段递进式学习

3.1 数据工程:难点与突破

训练一个”全能型”文档解析模型,数据是最大的挑战。

首先,文本标注相对容易获取——大量的PDF文档、结构化网页都可以自动生成文字标注。

视觉元素的监督信号极为稀缺。现实文档几乎不会提供图表对应的程序化表示(SVG代码)。你不能简单地”下载”一批带SVG标注的图表数据。

其次,可渲染程序具有”非唯一性”——不同的代码可以渲染出完全一样的视觉效果。这意味着:

  • 训练时需要标准化(canonicalization)
  • 质量控制非常困难
  • 评估时需要”render-and-compare”

再者,任务要求精确的视觉定位 + 长序列结构化生成,难度远高于纯文本OCR。

为了解决这些问题,MOCR团队构建了一个综合性数据engine,包含四大数据源:

(1)PDF文档

  • 使用dots.ocr作为自动标注引擎
  • 通过分层采样确保语言、领域、布局复杂度的多样性
  • 针对指令微调,进行规则检查和渲染验证,排除噪声

(2)网页渲染

  • 爬取真实网页并渲染为图像
  • 利用HTML/DOM结构作为对齐的监督信号
  • 提供天然的SVG原生图标、图表、图示

(3)原生SVG资产

  • 从各渠道收集真实SVG文件
  • 清洗:去除无关元数据、标准化数值精度、去重(代码层面 + 图像感知哈希)
  • 采样:按领域平衡 + 按复杂度平衡

(4)通用数据

  • 保持模型的基础视觉理解能力

3.2 三阶段训练配方

MOCR采用三阶段递进式训练,每阶段有明确的优化目标:

第一阶段:视觉-语言接口建立

  • 通用视觉训练,建立稳定的视觉-语言对齐
  • 让语言模型能够”读懂”视觉token

第二阶段:广义的预训练

  • 混合通用视觉数据 + 纯文本文档解析监督
  • 强化文本解析能力,同时保持通用视觉鲁棒性

第三阶段:MOCR专项强化

  • 降低通用视觉数据比重
  • 增加多模态文档解析(文本 + 图像转SVG)
  • 逐步提升输入分辨率,应对越来越难的页面解析和长结构化生成

整个过程中,始终保持单一的 autoregressive 目标函数,通过混合重加权和课程调度控制优化稳定性。

指令微调(SFT)

  • 使用数据工程精选的高质量样本
  • 针对SVG任务,进行专项处理:规范化、viewBox标准化、复杂度控制
  • 释放两个checkpoint:
    • dots.mocr:平衡版本
    • dots.mocr-svg:增加SVG权重,专门强化图像转SVG任务

4. 评估体系:超越传统指标的创新

4.1 传统指标的局限性

传统的OCR评估指标,如Word Error Rate(WER)、Normalized Edit Distance(NED),以及针对特定任务的TEDS(表格)、CDM(公式)等,存在明显问题:

  • 依赖规则匹配:对表面形式过度敏感
  • 无法评估结构保真度:无法判断”这份文档的解析结果是否忠实于原文档”
  • 对非唯一表示无能为力:比如SVG代码可以有N种写法

4.2 OCR Arena:LLM-as-a-Judge

MOCR团队提出了OCR Arena评估框架,用大模型来评估大模型

核心思想:

  • 使用Gemini 3 Flash作为”裁判”
  • 给定原文档图像 + 两个模型的输出,让裁判判断哪个更好
  • 统计Elo分数

关键设计:消除位置偏见

为了避免”先出现的答案更容易被选中”的偏见,团队采用对称评估协议

  • 每次A vs B的对比,做两轮试验
  • 轮次1:A在前,B在后
  • 轮次2:B在前,A在后
  • 只有两轮判断一致,才判定胜负

Elo rating系统

  • 借鉴国际象棋的评分机制
  • 1000次bootstrap重采样确保统计稳定性

这种评估方式的优势:

  • 不依赖表面字符串匹配,更接近人类感知
  • 能够捕捉”错误严重程度”的差异
  • 对结构化输出的评估更公平

5. 性能表现:全面屠榜

5.1 文档解析基准

olmOCR-BenchOmniDocBench v1.5XDocParse三个权威基准上,dots.mocr的表现如下:

表2:Elo对比(Gemini 3 Flash担任裁判)

模型
olmOCR-Bench
OmniDocBench 1.5
XDocParse
平均
Gemini 3 Pro
1180.4
1128.0
1323.7
1210.7
dots.mocr 1104.4 1059.0 1210.7 1124.7
dots.ocr
1041.1
1027.2
1190.3
1086.2
HunyuanOCR
997.6
1003.9
951.1
984.2
PaddleOCR-VL-1.5
897.3
997.9
866.4
920.5
GLM-OCR
884.2
972.6
820.7
892.5
MonkeyOCR-pro-3B
895.0
811.3
637.1
781.1

关键结论

  • 所有开源模型中排名第一
  • 与Gemini 3 Pro(闭源顶级模型)的差距仅约86 Elo分
  • 远超其他开源方案

表3:olmOCR-Bench分项得分

类别
最佳模型
dots.mocr
ArXiv论文
85.9
旧扫描件+数学
85.5
表格
90.7
多栏布局
85.3
总体
83.9

olmOCR-Bench上,dots.mocr创下83.9分的新纪录,超越Infinity-Parser 7B、olmOCR v0.4.0等强劲对手。

5.2 图表解析:逆袭Gemini 3 Pro

图3图3:总体性能对比——(a)文档内图像解析任务;(b)通用文档解析任务

在图表转SVG的任务上,dots.mocr-svg展现了令人惊喜的统治力:

表4:ISVGEN重建分数(越高越好)

方法
UniSVG整体
ChartMimic
Design2Code
GenExam
SciGen
ChemDraw
OCRVerse
0.763
0.799
0.881
Gemini 3 Pro
0.735
0.788
0.760
0.756
0.783
0.839
dots.mocr
0.894
0.772
0.801
0.664
0.660
0.790
dots.mocr-svg 0.902 0.905 0.834 0.800 0.797 0.901

关键亮点

  • 在UniSVG整体分数上,领先OCRVerse 13.9个百分点
  • ChartMimic、Design2Code、GenExam、SciGen、ChemDraw五个下游任务上全面超越Gemini 3 Pro
  • 尤其在结构敏感任务(化学结构、图表)上优势明显

5.3 通用VQA能力

虽然MOCR主攻文档解析,但在通用视觉问答任务上依然保持竞争力:

表5:通用VLM能力对比

模型
CharXiv描述
CharXiv推理
InfoVQA
DocVQA
ChartQA
OCRBench
AI2D
Qwen3-VL-2B
62.3
26.8
72.4
93.3
85.8
76.9
Qwen3-VL-4B
76.2
39.7
80.3
95.3
88.1
84.1
dots.mocr 77.4 55.3
73.76
91.85
83.2 86.0
82.16
  • CharXiv描述和推理上显著优于Qwen3-VL-4B(+1.2和+15.6分)
  • ChartQA上表现突出
  • OCRBench上保持强劲

这说明:统一文档解析和视觉语言训练,并不会损害模型的一般能力。

6. 应用前景:超越解析的更大图景

6.1 预训练数据的”新金矿”

MOCR最深远的影响,可能不在于文档解析本身,而在于它为多模态预训练开辟了全新的数据来源。

核心逻辑

过去的文档解析只能提取文本token。一份100页的PDF,解析后可能只有10KB的文本。

但MOCR可以同时输出:

  • 文本token(和过去一样)
  • SVG代码(过去被丢弃的图表信息)
  • 图像-SVG对(可用于图像到代码的对比学习)

也就是说:同样一份文档,现在可以提取出3-5倍的有效监督信号。

而且这些信号是可控的、可扰动的——你可以修改SVG代码的一个参数,生成”变体”,创造更多的训练数据。

论文中提到,MOCR的愿景是构建大规模image-to-code corpora(图像到代码语料库),用于多模态预训练。

6.2 更广泛的应用场景

除了预训练数据构建,MOCR的直接应用场景包括:

文档智能化处理

  • 合同审核:从扫描件中同时提取条款文字和表格、签章图像
  • 学术文献管理:将论文中的图表也结构化,便于检索和分析
  • 财务报告解析:同时提取文字描述和图表数据

UI/UX设计自动化

  • 设计稿转代码(Design2Code)
  • 界面元素提取和分析
  • 跨平台UI迁移

知识图谱构建

  • 从文档中提取实体关系(文字 + 图表共同作为证据)

教育科技

  • 教科书解析:公式、图表、示意图全部结构化
  • 智能答疑:基于结构化文档构建问答系统

7. 技术深挖:为什么MOCR能成功?

7.1 高分辨率视觉编码器

MOCR的视觉编码器有几点关键设计值得深入分析:

从零开始训练 vs 使用预训练权重(如CLIP、DINO)

论文选择从零训练一个12亿的视觉编码器,这是一个有意识的决策

预训练视觉模型(如ViT)通常针对自然图像优化,它们的特征表示对于密集文本+几何图形的文档场景并非最优。

通过从零训练,编码器可以针对性地学习:

  • 细粒度的字符识别
  • 密集文本和几何元素的联合建模
  • 跨字符、跨行的长程依赖

高分辨率策略

1.1M像素的输入分辨率意味着:

  • 一张A4纸大小的扫描件可以保持300 DPI以上的清晰度
  • 图表中的小字、刻度、图例都能被准确感知
  • 整个页面的空间关系得以完整保留

这对结构化输出至关重要——如果你在解析的第一步就丢失了位置信息,后续无论如何都无法准确重建文档结构。

7.2 图像转SVG的技术挑战

把图像”翻译”成SVG代码,是MOCR中最具挑战性的任务之一。论文中提到了几个核心难点:

非唯一性(Non-uniqueness)

  • 同一个视觉输出可以由无数种SVG代码实现
  • 这导致:
    • 训练时目标不唯一
    • 评估时难以判断”正确性”
  • 解决方案:canonicalization(规范化)+ render-based verification(基于渲染的验证)

渲染保真度

  • 模型生成的SVG必须能够忠实渲染原图像
  • 需要处理:颜色近似、字体回退、路径精度等问题

复杂度控制

  • SVG代码可以非常复杂(成千上万行)
  • 简单图形不应该被解析成过度复杂的代码
  • 需要复杂度感知的采样和训练

论文透露,这些问题通过数据engine的精细设计训练稳定化技术得到有效解决。

7.3 统一范式的优势

与过去”一个任务一个模型”的方案相比,MOCR的统一范式有几个优势:

知识迁移

  • 文档解析的视觉理解能力可以和图表解析相互促进
  • 表格识别学到的结构建模能力,有助于理解图表的布局

端到端优化

  • 避免了级联系统的误差累积
  • 整个 pipeline 可以联合优化

部署简洁

  • 一个模型替代过去5-10个专用模型
  • 维护成本大幅降低

8. 局限性与未来工作

8.1 当前局限

论文坦诚地指出了当前版本的一些局限:

任务条件化

  • 当前版本需要任务指令来指定解析目标
  • 尚未实现”一次输出同时包含完整文档解析和图表SVG”的单次前向传播

特定领域的gap

  • 在某些子任务上(如Headers & footers、Long tiny text),最佳分数由其他系统保持
  • 说明仍有提升空间

SVG质量的边界

  • 对于复杂的自然照片(无法用简洁程序描述),仍保留为raster
  • 并非所有图形都能完美转SVG

8.2 未来方向

论文提到了几个有价值的探索方向:

更多程序空间

  • TikZ(科学图形)
  • D3.js(交互式可视化)
  • CAD(工程图)
  • SMILES(化学结构)

网页解析扩展

  • 当前已支持网页渲染
  • 未来可以更深度地利用网页的DOM结构

自我改进的数据飞轮

  • 用模型自身来筛选和生成更高质量的训练数据
  • tighter render verification loops

更智能的评估

  • 论文提出的OCR Arena是一个重要创新
  • 类似的judge-based评估协议可能成为结构化输出评估的标准方法

9. 行业启示:文档AI的新篇章

9.1 从”提取”到”理解”

MOCR代表了一种根本性的范式转变:

过去:OCR = 光学字符识别 → 把图片变成文字 未来:OCR = 文档理解 → 把文档变成结构化知识

这一转变的核心驱动力是视觉语言模型的成熟。当模型能够”看懂”图表、能够”推理”布局关系时,文档解析就不仅仅是”识别”,而是真正的”理解”。

9.2 开源的意义

值得注意的是,MOCR开源了代码和模型权重。

这意味着:

  • 学术研究者可以基于它进行二次创新
  • 产业界可以低成本地部署和应用
  • 社区可以共同推动技术进步

在当前”闭源模型霸榜”的趋势下,开源工作更能推动整个领域的民主化。

9.3 多模态预训练的新范式

论文反复强调一个观点:文档是未被充分利用的多模态预训练数据源

过去,我们只从文档中提取文本;现在,我们可以提取”文本 + 代码 + 图像-代码对”。

这可能开启一个数据 scale的新时代——同样数量的文档,可以产生3-5倍的有效训练数据。

10. 总结

MOCR是一项具有里程碑意义的工作。它重新定义了”文档解析”的边界:

  • 从识别文字,到理解一切:文本、表格、公式、图表、图标、UI组件,都是第一类解析目标
  • 从保存像素,到生成代码:图表被解析为可编辑、可计算、可复用的SVG代码
  • 从单一任务,到统一框架:一个模型处理所有文档解析需求
  • 从信息丢失,到信息回收:文档中的视觉元素不再是”不可描述的垃圾”,而是结构化的知识

性能表现同样亮眼:

  • 在OCR Arena Elo排行榜上仅次于Gemini 3 Pro(开源第一)
  • 在olmOCR-Bench上创下83.9分的新纪录
  • 在图表转SVG任务上全面超越Gemini 3 Pro
  • 全部在3B参数的紧凑模型上实现

这项工作来自华中科技大学(HUST)和小红书hihlab的联合团队,是高校与工业界协作的典范。

我们有理由相信,MOCR代表的是文档AI的未来方向——从text-centric OCR,走向document-native multimodal parsing。

看完不过瘾,那就自己发一篇吧!
© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
相关推荐
评论 抢沙发

请登录后发表评论

    暂无评论内容