2026 开源 PDF 解析库全景:从文本抽取到文档智能¶
发布于:2026-09-19 | 分类:document analysis
最近使用 Claude Opus 5 将一份扫描的PDF合同转换为markdown,惊异于圆形公章上公司名及手写签名都能正确识别,心血来潮想看看开源领域 PDF 文档解析库的发展状态。于是经过 Kimi2.7、Qwen3.8-max 起草初稿、WorkBuddy 内置 Hunyuan 3 整理及 13 版修订、DeepSeek-v4.1-flash、Claude Opus 5 最终审核,生产了本文调研报告。
区别于 Python处理PDF的第三方库对比 关注对 PDF 文档本身的操作能力如提取/创建内容、增删页面等,本报告更偏向文档理解——语义级别的内容提取。
PDF 作为事实上的“电子纸张”标准,承载了海量的论文、合同、财报、研报与档案。然而 PDF 本质是面向“打印排版”的格式,而非结构化数据格式,文本、表格、公式、图片混杂,多栏、跨页、扫描件、水印等情形进一步加剧了机器理解的难度。随着 RAG(检索增强生成)、大模型训练语料构建、企业知识库与 Agent 工作流的兴起,对 PDF 高质量、结构化解析 的需求从“能读出字”升级为“能还原版式、表格、公式与阅读顺序”。
在合规(HIPAA / GDPR / 数据不出域)、成本(商业 API 按页计费,规模化后昂贵)与可控性(可微调、可私有化部署)三重驱动下,自托管开源方案成为企业级文档智能的可行乃至必选路径。而在纯离线/涉密场景,开源是唯一合规选项。因此,本报告围绕开源方案展开,按 OCR(光学字符识别)、版面分析、信息提取 三大理解能力维度,对 40+ 个主流开源库进行系统化梳理;其中信息提取细分为 信息抽取(结构化字段)、表格提取、公式提取 三类子任务。
本报告重点调研了 MinerU、Docling、Marker、olmOCR、Unstructured、DeepDoctection、DocXChain 等综合平台,Tesseract / PaddleOCR / EasyOCR / Surya / GOT-OCR 2.0 / HunyuanOCR / Dots.OCR 等识别引擎,以及 Camelot / Tabula / pdfplumber / TableTransformer 等表格与文本提取工具。报告给出精度基准对比,并总结以视觉语言模型(VLM)端到端为代表的下一代技术趋势。此外,针对通用视觉语言模型(VLM)作为解析后端,系统梳理了 PaddleOCR-VL、Qwen2.5-VL、InternVL2.5、GLM-4V-9B、MiniCPM-V 2.6、DeepSeek-OCR 等以 VLM 为底座的文档解析方案。
核心结论:
-
中文团队主导创新节奏,中文生态居全球第一梯队:MinerU(80.2k★)、PaddleOCR(79k+★)、dots.ocr(小红书)、DeepSeek-OCR、GOT-OCR 2.0(阶跃星辰)等头部项目多来自中国团队,中文文档/公式/表格场景适配红利显著;OmniDocBench、olmOCR-Bench 等公开基准长期由中文项目占据前列。
-
技术范式已分化为“Pipeline 模块化”与“VLM 端到端”两派,且头部项目均已融合:2026 年实际格局是“管线(低成本兜底)+ VLM(高精度攻坚)”双后端并存,配合“默认快路径、低置信升级重路径”的级联策略。
-
精度维度:PaddleOCR-VL-1.6(0.9B 小模型,OmniDocBench v1.6 96.33 居小模型前列,2026 Q3 起已被 OvisOCR2 96.58 / TeleOCR 96.87 超越)与 MinerU2.5-Pro(95.75)同处第一梯队。
-
选型无单一赢家,须按场景匹配:追求中文文档与公式/表格精度选 MinerU 或 PaddleOCR;追求工程集成与多格式统一表示选 Docling;追求 CPU 轻量部署选 Marker(fast)或 PP-OCRv5 mobile;追求极致精度且有 GPU 选 dots.mocr / olmOCR / DeepSeek-OCR;面向 LLM/RAG 数据流水线选 Unstructured 与前述解析器组合。
-
许可证与部署维度:Docling(MIT、65+ 格式、可纯 CPU 运行)与 PaddleOCR(Apache-2.0,代码与权重均无商用限制)最宽松;MinerU(≥3.1.0 转 Apache-2.0 系 MinerU Open Source License)与 Marker(代码 Apache-2.0)2026 年也已大幅放宽,但二者模型权重仍设营收/融资门槛;Nougat 与 LayoutLMv3 权重 CC-BY-NC / CC BY-NC-SA 4.0,禁商用。
1. PDF 文档解析的挑战与技术演进¶
一个完整的 PDF 解析系统通常需协同解决下表所示子任务。传统工具(如 pdftotext)在真实文档上暴露出典型失效:公式丢失或乱码;表格结构崩坏;图片被忽略;页眉页脚混入正文、段落被随意切割;多栏布局下阅读顺序错乱。其根源在于 PDF 不保存语义结构,仅保存绘制指令如字符、线段、图像的位置与样式。
更细分的难点包括:数字原生 PDF(含文本层)vs 扫描版/图层型 PDF(文字不可复制、乱码);有线表格(lattice)vs 无线/白隙表格(stream);合并单元格、跨页表格、嵌套表头;行内/行间公式;旋转版面与页眉页脚去噪;竖排文字、印章、手写等等。
任何单一方案都难以覆盖全部长尾情形。
| 子任务 | 说明 | 典型难点 |
|---|---|---|
| 版面/布局检测 | 定位标题、正文、图、表、公式、印章等区域 | 多栏、图文混排、旋转、密集表格 |
| 阅读顺序恢复 | 按人类阅读顺序串联区域 | 多栏论文、报纸、教材 |
| OCR 文字识别 | 图像文字 → 字符序列 | 多语言、手写体、低质扫描件 |
| 表格识别 | 还原行/列/单元格结构 | 无线表、合并单元格、跨页表 |
| 公式识别 | 印刷/手写公式 → LaTeX | 嵌套结构、行内公式 |
| 页眉页脚/水印剔除 | 去除与正文无关的重复元素 | 与正文的区分 |
| 关键信息提取(KIE) | 抽取字段级语义(金额、日期、甲乙方等) | 版式多样性、少样本适应 |
为了解决上述难点,PDF 文档解析技术经历了从 OCR 到文档智能的演进。
- 传统 ML 引擎(Tesseract v4+ LSTM):CPU 友好、成熟稳定,但弱于版面与手写;
- 深度学习检测-识别级联(PaddleOCR、EasyOCR、Surya):检测(DBNet/PP-YOLO)+ 识别(CRNN/SVTR)+ 版面(LayoutParser/PP-Structure),精度大幅提升;
- 端到端视觉语言模型(VLM)(Nougat、GOT-OCR 2.0、HunyuanOCR、Dots.OCR、olmOCR、MinerU 2.5 内置 VLM):单次前向推理直接输出结构化文本/公式/表格,消除级联误差累积,成为 2025 年后的主流方向。
- 通用 VLM 作为解析后端(Qwen2.5-VL、InternVL2.5、GLM-4V-9B、MiniCPM-V 2.6):并非专门的 PDF 解析器,但凭强大文档理解/定位能力被广泛封装为自研解析服务,或嵌入 MinerU/PP-Structure 的数据构建管线,是 VLM 范式在工程侧的延伸。
2. 技术体系与能力分类¶
2.1 技术路线的两大范式¶
据公开资料,PDF 文档解析范式可以归为两类。2026 年头部项目已呈融合态势,例如 Docling 增加 Granite-Docling-258M VLM 路径;MinerU 同时保留经典管线后端供纯 CPU 场景;Marker 2 定位为Surya 模型套件的编排器,其质量上限即 Surya 的质量上限。
| 范式 | 原理 | 代表 | 优点 | 缺点 |
|---|---|---|---|---|
| Pipeline 模块化 | 检测/识别/版面/表格/公式各用专用模型,串行组装 | Docling、PaddleOCR PP-StructureV3、Marker(Surya 套件)、MinerU 管线后端 | 可解释、可替换单模块、易私有化微调、CPU 可跑 | 误差级联、工程复杂 |
| VLM 端到端 | 单模型直接"看图吐 Markdown/JSON" | MinerU2.5、PaddleOCR-VL、Marker 2、Granite-Docling、GPTPDF、Zerox、olmOCR | 复杂版面鲁棒、训练成本外置 | 推理开销大、依赖 GPU、黑盒 |
2.2 按功能维度分类¶
PDF 解析的理解能力归为 OCR、版面分析、信息提取三大维度;信息提取细分为三类子任务(见下表)。
| 能力维度 | 解决的问题 | 代表性开源库 |
|---|---|---|
| OCR(文字识别) | 扫描件/图片/乱码 PDF 的文本抽取,含多语种、手写 | Tesseract、PaddleOCR、EasyOCR、Surya、GOT-OCR 2.0、HunyuanOCR、Dots.OCR |
| 版面分析(Layout) | 区分标题/正文/表格/图片/公式区域,还原阅读顺序与层级 | LayoutParser、PP-Structure、360LayoutAnalysis、DocLayout-YOLO、DocLayNet(Docling)、PDF-Extract-Kit(MinerU 同团队工具包,含 DocLayout-YOLO / YOLO-v10 / LayoutLMv3 可选) |
| 信息提取(IE) | 从文档中抽取结构化信息(含三类子任务,统一见 3.4:3.4.1 表格 / 3.4.2 公式 / 3.4.3 KIE) | — |
信息提取的三类子任务:
| 子任务 | 解决的问题 | 代表性开源库 |
|---|---|---|
| 信息抽取(KIE) | 从票据/合同/表单抽取关键字段与实体关系 | PP-ChatOCR、Unstructured、DeepDoctection、DocXChain、GLM-OCR、HunyuanOCR(开放字段) |
| 表格提取(Table) | 有线/无线/跨页/合并单元格表格的结构化重建 | Camelot、Tabula、pdfplumber、TableTransformer、gmft、StructEqTable |
| 公式提取(Formula) | 行内/行间公式识别为 LaTeX / MathML | UniMERNet、PP-FormulaNet、Surya LaTeX、Nougat、GOT-OCR 2.0 |
注:上表「信息提取三类子任务」列出的是 专用/代表性工具;需强调,端到端文档解析系统(MinerU / Docling / Marker / olmOCR 等)同样内置表格提取、公式识别与 KIE 能力——二者并非互斥关系。
选型时,若只需拆出单张表/单个字段,用专用工具(Camelot、pdfplumber、PP-ChatOCR)即可;若需全文档结构化 + 阅读顺序 + 多格式输出,则端到端平台更合适。
3. 主流开源库¶
3.1 综合型文档解析平台¶
MinerU(OpenDataLab / 上海人工智能实验室) OCR·版面·表格·转换
- 仓库:
opendatalab/MinerU;许可证:MinerU Open Source License(基于 Apache-2.0 的自定义许可;≥3.1.0 由 AGPLv3 切换,超 100M MAU 或 $20M/月营收需商业授权、对外在线服务须标明);活跃度:约 80.2k★(2026-09)。 - 定位:将 PDF、图片及 Office 文档转换为 LLM-Ready 的 Markdown / JSON 的高精度解析工具,中文社区事实标杆。
- 核心能力:去页眉/页脚/页码/脚注、还原多栏阅读顺序;OCR 约 109 种语言;公式检测+识别输出 LaTeX;表格识别输出 HTML/OTSL;自动提取图片并引用;输出 Markdown、middle-json、model-json 多层结构化格式;4.0 引入质量四档(flash/basic/standard/advanced)、本地文档库、面向 Agent 的 CLI(按页/块续读、稳定定位符 locator)。
- 技术架构:双后端——传统 pipeline 后端(版面检测+公式/表格/OCR 专用模型级联,小模型 ONNX CPU 推理)与 VLM 后端(MinerU2.x/2.5 系列 1.2B,llama.cpp + Vulkan,NVIDIA GPU 可装
mineru[full]用 vLLM/lmdeploy 提吞吐)。 - 性能参考:OmniDocBench v1.6:MinerU2.5 93.04 / MinerU2.5-Pro 95.75(同规模组榜首);olmOCR-Bench 75.2(2.5.4)。2026 年陆续发布 3.4(2026-06-18,pipeline 换 PP-OCRv6,较 2.5 +11%)、4.0(四档 tier、9 种渲染输出、本地文档库)。
- 部署要求:Python 3.10–3.14;默认 CPU 可跑,GPU 大幅提吞吐;支持 Windows/macOS/Linux。
- 小结:中文文档、学术论文(公式/表格密集)首选之一;生态成熟、与主流 RAG 框架集成广。注意点:附加商业条款、VLM 后端显存需求。
Docling(IBM Research → LF AI & Data 基金会) 版面·表格·转换
- 仓库:
docling-project/docling;许可证:MIT(宽松,无权重商用门槛);活跃度:约 66.6k★(2026)。 - 定位:"Get your documents ready for gen AI"——面向生成式 AI 的统一文档处理框架。
- 核心能力:输入格式覆盖最广(PDF/DOCX/PPTX/XLSX/HTML/EPUB/邮件/音视频/XBRL 等);DocLayNet 版面 + TableFormer 表格重建(FinTabNet TEDS>91%)+ 多引擎 OCR;元数据提取(标题/作者/参考文献/语言);统一中间表示 DoclingDocument,导出 Markdown/HTML/JSON/DocTags/WebVTT;
--pipeline vlm(GraniteDocling 258M,Apache-2.0);LangChain/LlamaIndex/CrewAI/Haystack 官方集成、MCP Server、docling-serve。 - 性能参考:olmOCR-Bench 50.3%(数字版子集 64.0%),强项不在卷 OCR 精度而在格式覆盖与生态集成。
- 部署要求:Python 3.10+;CPU 可跑、GPU 可选;支持完全本地/离线(air-gapped)。
- 小结:MIT + 基金会治理 + IBM 背书,企业级多格式文档 ETL 与 RAG 集成稳健选择;中文公式/手写极限精度弱于 MinerU、PaddleOCR。注意:PDF→DOCX 排版级还原非其目标。
Marker(Datalab) OCR·版面·转换
- 仓库:
datalab-to/marker;许可证:代码 Apache-2.0 + 权重 AI Pubs OpenRAIL-M(研究/个人/初创 <$5M 营收或融资免费,超出需购商业授权);活跃度:约 39.8k★(2026)。 - 定位:快速、高精度地将文档转换为 Markdown / JSON / chunks / HTML。
- 核心能力:输入 PDF/图/PPTX/DOCX/XLSX/HTML/EPUB,全语言;输出 Markdown/JSON/RAG chunks/HTML;表格/表单/公式/链接/引用/代码块格式化;
--use_llm可选接 LLM 做跨页表合并、表单值抽取、行内公式修复;架构可扩展。 - 技术架构:深度学习流水线,核心依赖同门 Surya 模型族——balanced 模式用 Surya VLM 做版面+行内公式 OCR+坏页重识别;fast 模式用 rf-detr 版面 + pdftext 文本层提取,仅对公式与损坏块做 VLM 点状修复,纯数字文档可完全绕开 VLM,CPU 友好。2026-07 发布重写版 Marker 2(Surya OCR 2 ~650M、20M 快速版面、pdftext 快约 3×;结构化抽取 converter 移除,改
--use_llm/托管 API)。 - 性能参考:olmOCR-Bench balanced 76.0%(数字版 83.5%);dots.ocr 仓库引用 Marker 1.10.1 为 76.1。
- 部署要求:Python 3.10+;GPU/CPU/MPS 均可;balanced 需 vLLM(NVIDIA)或 llama.cpp。
- 小结:速度精度平衡好、多格式齐全、RAG 友好;最大风险是权重商用许可门槛(融资/营收超 $5M 需付费)。同公司另有旗舰 Chandra 2(olmOCR-Bench 85.8–85.9,高于 dots.mocr 83.9),评估 Datalab 生态应以 Chandra 2 为质量锚点。
PaddleOCR 3.x(百度飞桨) OCR·版面·表格·转换
- 仓库:
PaddlePaddle/PaddleOCR;许可证:Apache-2.0(代码与权重均无商用限制);活跃度:79k+★(2026-09,用户遍布 160 国)。 - 定位:从经典 OCR 工具包升级为“OCR + 文档解析 + 文档理解”三位一体体系,三大核心方案:
- PP-OCRv5(文字识别):单模型统一简/繁/拼音/英/日,server / mobile 双版本(mobile 面向纯 CPU 与端侧);
- PP-StructureV3(文档解析):PP-DocLayout 版面 + 表格/公式(PP-FormulaNet)/图表(PP-Chart2Table)/印章/阅读顺序一体化,“一键输出 JSON + Markdown”,支持 Word/docx 输出;
- PP-ChatOCRv4-doc(KIE):轻量 OCR 与 ERNIE-4.5、PP-DocBee2(3B 多模态)RAG 融合,关键信息抽取端到端 Recall@1 85.55%(官方自报,称超 GPT-4o 22 个百分点)。
- 配套:PaddleOCR-VL(0.9B VLM,见 3.5);训练/推理/部署工具链完整,支持昆仑芯、昇腾等国产硬件异构加速。
- 小结:中文场景综合最强全家桶,从端侧 mobile 到服务器级 VLM 全覆盖,Apache-2.0 无商用顾虑;代价是绑定 PaddlePaddle 框架,组件繁多、上手略陡。
olmOCR(Allen Institute for AI) OCR·版面
- 仓库:
allenai/olmocr;许可证:Apache-2.0(代码与权重均宽松)。 - 定位:PDF 大规模“线性化”(转 Markdown/纯文本)工具链,主打 LLM 训练/RAG 高质量语料。
- 核心能力:直接处理 PDF 原文(正文/标题/章节/表格/公式/手写),清除页眉/页脚/水印,保留元数据,输出干净 Markdown;成本主张鲜明(每百万页 <$200,官方口径);基于 Qwen2-VL 系微调(7B 级),vLLM 推理;olmOCR 2 引入 Unit Test Rewards(RL 奖励);副产品 olmOCR-Bench 成行业通用基准。
- 性能参考:olmOCR v0.4.0 在 olmOCR-Bench 总分 82.4(dots.ocr 仓库引用),高于 marker(76.1)与 MinerU 2.5.4(75.2)。
- 部署要求:Python + vLLM;本地 GPU / Docker / AWS S3 集群均可;7B 模型对显存有要求(常 A100/H100 + vLLM)。
- 小结:许可最宽松、面向海量页级批处理的 VLM 方案,学术背书、评测透明;小规模单位成本高于 1B 级专用小模型。
Unstructured(Unstructured.io) 版面·提取·转换
- 仓库:
Unstructured-IO/unstructured;许可证:Apache-2.0(open-core,LICENSE 核验)。 - 定位:非结构化数据 ETL 库——不做最强解析,做最通用元素化切分,是 RAG/LLM 数据管道事实标准组件之一。
- 核心能力:
partition系列 API 将 PDF/DOCX/PPTX/HTML/EML/图等 20+ 格式统一切分为带类型标签元素(Title/NarrativeText/Table/ListItem 等)并附页码/坐标;fast(文本层)/hi_res(版面+OCR)/ocr_only/auto 多策略;内置 chunking、清洗、staging(JSON/CSV/DataFrame);与 LangChain、LlamaIndex 深度集成;可 Docker 化。 - 小结:以信息提取 + 数据管道见长;表格/公式极限还原不如 MinerU、PaddleOCR 等专业解析器。常见组合:Unstructured 做统一元素层,专业解析器做 PDF 深度解析。
其他值得关注:
- PDF-Extract-Kit(OpenDataLab 高质量抽取工具箱,AGPL-3.0)
- DeepDoctection(Detectron2 全家桶,RAG 场景)
- DocXChain(阿里达摩院模块化工具链,中英开箱)
- Chandra / Chandra 2(Datalab 旗舰模型,olmOCR-Bench 85.8–85.9)
- MonkeyOCR-pro-3B(华科,Elo 781.1)
- HunyuanOCR(腾讯,331 语种,Tencent Hunyuan Community License)
- GLM-OCR(智谱,0.9B)
- SmolDocling / GraniteDocling(超小 VLM,DocTags)
- Infinity-Parser(olmOCR-Bench 82.5+)
- omniparse / open-parse / chunkr(视觉模型驱动分块)
- pdf-extract-api(OCR+Ollama,匿名化/去 PII)
- MarkItDown(微软“任意文件→Markdown”胶水层,MIT)
- Parxy(统一 API 网关,多解析器 A/B 与灰度切换)
3.2 文本获取:底层文本抽取与 OCR 识别¶
把 PDF 中的文字“取出来”有两条互补路径:数字原生 PDF 自带文本层(直接读取即可,无需识别),扫描/图片 PDF 则需 OCR 识别。二者均属最底层的文本获取,区别于语义级的信息提取。
3.2.1 底层文本抽取(数字原生 PDF 文本层)¶
| 工具 | 许可证 | 文本 | 备注 |
|---|---|---|---|
| PDFMiner.six | MIT | 优 | 底层文本/坐标提取,众多库的基础 |
| PyMuPDF (fitz) | AGPL-3.0 | 快/优 | 渲染级高速文本抽取,无 OCR/版面;RAG 轻量管线常用 |
| pdfplumber | MIT | 优 | 字符/线/曲线级精细控制,调试首选 |
| PyMuPDF4LLM | AGPL-3.0 | 优 | 在 PyMuPDF 上叠加 Markdown 输出 |
数字原生 PDF 应直接读文本层而非逐页 OCR(Docling 官方称快 30×);PyMuPDF / pdfplumber 在 CPU 上单页仅个位数毫秒。文本层不含阅读顺序、分栏、表格单元格概念,本质是“带坐标的字形袋”。
3.2.2 OCR 识别引擎(扫描件/图片/乱码 PDF)¶
| 引擎 | 许可证 | 语种 | 参数量/规模 | 核心特点 | 最佳场景 |
|---|---|---|---|---|---|
| Tesseract | Apache-2.0 | 100+ | — | LSTM、CPU 优先、生态最成熟;版面分析能力弱(仅 PSM 页面分割模式,无结构化输出) | 多语种印刷体批量数字化、离线 |
| PaddleOCR / PP-OCRv6 | Apache-2.0 | 100+ | tiny 1.5M / medium 34.5M / server | 2026-06 发布,DB++ 检测 + SVTR_LCNet 识别,OpenVINO 在 Intel CPU 约 5.2×、M4 约 6.1× 加速;PP-StructureV3 复杂文档解析;GitHub 79k+ Star(已超越 Tesseract) | 中文政务/金融/产业级、边缘 |
| EasyOCR | Apache-2.0 | 80+ | — | PyTorch、API 极简、抗干扰强;无表格/版面模块 | 多语种轻量快速原型 |
| Surya | 代码 Apache-2.0;权重 Modified AI Pubs OpenRAIL-M(<$5M 免费,旧 CC-BY-NC-SA 4.0) | 90+ | 650M(识别模型单体) | Transformer,复杂/旋转表格识别强,含阅读顺序 | 财务/学术多栏复杂文档(Marker 2 底座) |
| GOT-OCR 2.0 | 研究用途(原仓库)/ Apache-2.0(HF 卡,存争议) | 50+ | 580M | 阶跃星辰,端到端 VLM(ViTDet + Qwen-0.5B),统一文本/公式/图表/乐谱/分子式,显存 <3GB | 科技文献/结构化文档、低显存 |
| HunyuanOCR | Tencent Hunyuan Community License(排除 EU/UK/韩国) | 331(arXiv:2607.04884) | 1B | 腾讯端到端 VLM,OmniDocBench v1.6 94.74(HunyuanOCR-1.5)、OCRBench 860 | 轻量 SOTA、消费级 GPU |
| Dots.OCR → dots.mocr | MIT | 100+ | 1.7B → 3B | 小红书 hi-lab VLM,统一版面+内容,比 GPT-4o/Gemini 快 10×;独特支持图表→SVG 代码;olmOCR-Bench 83.9 | 复杂多语种文档、图表矢量重建 |
| Dolphin | Apache-2.0 | 50+ | 400M+ | 先分析后解析复杂版面 | 复杂版面文档 |
| GLM-OCR | MIT | 30+ | 0.9B | 智谱,支持 schema 引导 JSON 结构化输出,Ollama 可部署 | 中文 KIE/字段抽取、学术内容 |
| DeepSeek-OCR 2 | MIT | 30+ | 3.39B(MoE) | 中英文档,MoE 降低单页推理成本 | 中英文档、批量云管线 |
| Baidu Unlimited-OCR | MIT | 40+ | 3B | 多页 PDF 单次通过、HTML+LaTeX 结构化输出 | 多页结构化批量 |
| LightOnOCR-2 | Apache-2.0 | 20+ | 1B | 法语/欧洲语种优化 | 法语/欧洲语种 |
| Florence-2 | MIT | 100+ | 770M | 通用视觉任务基座 | 通用视觉+OCR 组合场景 |
关于手写识别的定性结论:Surya 在开源方案中综合最佳,Nougat 手写尚可,Tesseract 在 CPU 上极快但手写弱;超大模型 Qwen2.5-VL-72B 手写最强。
3.3 版面分析专用¶
-
LayoutParser(Zejiang Shen 等,Allen Institute for AI / Brown / Harvard / UW / Waterloo,arXiv:2103.15348):基于 Detectron2(Meta)等可插拔后端的文档图像分析工具箱,内置学术论文/报纸/表格预训练模型,准确率 90%+。
-
PP-Structure / PP-StructureV3(PaddleOCR 团队):五模块架构(预处理→OCR→版面→文档项识别→后处理)。版面分析用 PP-DocLayoutV2——在 PP-DocLayout_plus-L(RT-DETR-L)之上级联 6 层 Transformer 轻量指针网络;检测框与类别经绝对二维位置编码嵌入,注意力引入 Relation-DETR 几何偏置建模元素间成对几何关系,由成对关系头产生 N×N 相对顺序矩阵,再用确定性 "win-accumulation" 解码还原拓扑一致的阅读顺序;自建评测集含 1,000 张图、覆盖 25 类版面元素(文档标题、章节标题、正文、竖排文字、页码、摘要、目录、参考文献、脚注、图题、页眉/页脚、算法、行内/行间公式、公式编号、图、表、印章、图表、旁注等)。PubLayNet mAP 96.2。
-
360LayoutAnalysis:360 开源版面检测模型,中文文档适配。
-
DocLayout-YOLO:基于 YOLO 的高速区域检测,社区流行,轻量易部署。
-
LayoutLMv3 / LayoutXLM / LiLT:多模态版面理解预训练(详见 3.4.3),多作为下游微调底座而非独立解析器。
-
RT-DETR / Heron:实时检测 Transformer,Docling 采用做区域检测。
3.4 信息提取专项¶
本节整合「信息提取」的三类子任务——表格提取、公式提取、信息抽取 KIE:版面分析先定位表格/公式/字段区域,本层再对框内网格结构、公式符号与语义字段做精细化重建。三者即广义“从文档中抽取结构化信息”,是理解能力的最终落点。
3.4.1 表格提取¶
| 工具/模型 | 许可证 | 有线表 | 无线表 | 合并/跨页 | 输出 |
|---|---|---|---|---|---|
| Camelot | MIT | 优 | 良 | 部分 | CSV/Excel/JSON/SQLite |
| Tabula(-py) | MIT | 优 | 良 | 弱 | CSV/TSV/JSON |
| pdfplumber | MIT | 优 | 优 | 部分 | 代码→DataFrame |
| TableTransformer (TATR) | MIT(MS) | 优 | 优 | 良 | 图像/PDF(需 GPU) |
| gmft | MIT | 优 | 优 | 部分 | DataFrame/CSV |
| StructEqTable-Deploy | — | 表格→LaTeX 高效工具包 | LaTeX |
经验法则:有线表格用 Camelot(flavor="lattice") 或 Tabula;无线/白隙表用 Camelot(flavor="stream") 或 pdfplumber;图片原生/复杂合并单元格用 TableTransformer 或 VLM 平台(MinerU/Docling)。2025 年工业界标准答案已转向 layout-aware 解析器(MinerU/Docling/Marker)。
深度学习表格结构识别(TSR)模型:规则/几何方法之外,工业级表格结构重建由专用模型支撑——TableFormer(Docling,金融表格强,FinTabNet TEDS>91%)、SLANet / SLANet_plus(PaddleOCR)、PP-TableMagic(PaddleOCR);TATR(微软)在财务/专利/法律/科学文献类表格检测领先。
3.4.2 公式提取¶
公式提取 = 公式检测(MFD, Mathematical Formula Detection) + 公式识别(MER / im2latex):先由检测模型在页面中定位行内/行间公式框,再由识别模型将裁剪图转为 LaTeX / MathML。难点在于公式是严格二维、可嵌套(上下标、分式、根式、矩阵、多行对齐)的结构,传统 OCR 把公式当一维文本会丢失层级;评价指标除 BLEU、归一化编辑距离(EditDistance)外,CDM(Content Detection Match,UniMERNet 提出) 因不受 LaTeX 等价表达多样性影响,正成为更公平的公式识别度量。
主流公式识别库 / 模型:
| 库 / 模型 | 机构 | 许可证 | 架构 / 输出 | 关键性能(版本钉死) | 定位 |
|---|---|---|---|---|---|
| UniMERNet | 上海 AI Lab / OpenDataLab | Apache-2.0(代码+权重) | Donut-Swin 编码 + mBART 解码;LaTeX | CDM 全面优于 Texify/GOT 乃至 72B/78B VLM(CVPR 2026);base ExpRate 84.6% / large 87.3% | 真实场景复杂/手写公式,MinerU 默认后端 |
| PP-FormulaNet / plus | 百度 PaddleOCR | Apache-2.0 | plus-L(Vary-ViT-B)等;LaTeX | En-BLEU 92.22 / Zh-BLEU 90.64(plus-L);S 版约快 10× | 中英文公式、追求速度/工程集成 |
| LaTeX-OCR(pix2tex) | Lukas Blecher | MIT | ViT 编码(ResNet 骨干)+ Transformer 解码;LaTeX | BLEU 0.88 / normED 0.10(im2latex-100k) | 开源基线,仅块级公式 |
| Nougat | Meta(FAIR) | MIT 代码 + CC-BY-NC 4.0 权重(禁商用) | Donut 编码-解码(2×Swin,350M+250M);Mathpix Markdown | 英文学术 PDF 公式/表格保真标杆 | 英文学术文献数字化 |
| Surya LaTeX | VikParuchuri / Datalab | Apache-2.0 代码 + Modified AI Pubs OpenRAIL-M 权重(<$5M 免费) | 650M VLM;LaTeX | 公式支持较 Nougat/GOT 有限(见 3.5) | Marker 后端,通用 OCR 附带公式 |
| GOT-OCR 2.0 | 阶跃星辰(StepFun) | Apache-2.0(HF 卡;原仓库标"研究用途",口径存异,见 4.3) | Vary 编码 + Qwen 解码;统一文本/公式/图表/乐谱 | 公式→LaTeX,低显存 <3GB | 统一端到端 OCR(详见 3.5) |
| Texify | VikParuchuri / Datalab | GPL-3.0 代码 + CC-BY-SA 4.0 权重(可商用) | Donut 衍生;LaTeX+Markdown | 已**弃用**,功能并入 Surya | 历史基线,行内+块级公式 |
| Mathpix Snip | Mathpix(商业) | 闭源 / 付费 API | 云端深度学习 OCR | 印刷体公式 ~95%+,业界金标准 | 商业基准锚点(非开源) |
识别之前需先定位公式。专用检测模型包括 YOLOv8 微调(PDF-Extract-Kit,AP50≈87.7)、Pix2Text-MFD(AP50≈60.1);UniMERNet 也提供基于 PDF-Extract-Kit MFD 的教程。
综合工具包:
- PDF-Extract-Kit(OpenDataLab):布局检测(DocLayout-YOLO 默认,另支持 YOLO-v10 与 LayoutLMv3 精度优先)+ 公式检测(YOLOv8)+ 公式识别(复用 UniMERNet 权重)+ OCR(PaddleOCR)的模块化工具包,公式识别直接调用 UniMERNet、无需额外微调;各子模型遵循各自许可证(见 4.3)。
- Pix2Text(breezedeus):国产类 Mathpix 工具,覆盖公式检测+识别(底层复用 LaTeX-OCR),提供易用 API,适合中文公式快速接入。
选型逻辑:追求真实场景复杂/手写公式精度且可商用 → UniMERNet(MinerU 默认);追求中文本地化与高吞吐 → PP-FormulaNet_plus;只需块级公式快速验证 → LaTeX-OCR(pix2tex);英文学术 PDF 数字化且不考虑商用 → Nougat;低显存统一 OCR+公式 → GOT-OCR 2.0;严禁依赖外部 API 的产线应避开 Mathpix。
3.4.3 信息抽取(KIE)¶
版面解析之上,面向“从文档中抽取结构化字段(发票号、金额、日期、实体)”的任务:
| 模型 | 机构 | 架构 | 特点 | 代表成绩 / 许可 |
|---|---|---|---|---|
| LayoutLMv3 | 微软 | OCR tokens + 布局 + 图像三模态 | 英文表单 F1 最高,需 OCR 预处理 | FUNSD 92.08 F1;DocVQA ANLS 83.37(开源 SOTA);权重 CC BY-NC-SA 4.0(非商用) |
| LayoutXLM | 微软 | LayoutLMv2 多语言版 | 53 语言预训练 | 多语言表单理解 |
| LiLT | 学术界 | 布局/文本双 Transformer 解耦 | 可插拔任意语言模型,跨语言零样本迁移 | FUNSD 88.41(配 InfoXLM) |
| Donut | NAVER | OCR-free Swin + mBART | 免 OCR、像素直出 JSON;训练成本高 | CORD 84.1 F1 |
| PP-ChatOCRv4 | 百度 | 轻量 OCR + ERNIE 4.5 | 中文 KIE 开箱即用,精度较上代 +15pct | 中文票据/证照场景 |
| TrOCR / GLM-OCR | 微软 / 智谱 | 生成式 OCR | TrOCR 文本行识别;GLM-OCR 可 Ollama 部署、schema 引导 JSON | MIT/Apache 许可 |
3.5 通用视觉语言模型(VLM)作为解析引擎¶
通用 VLM 不是专门的 PDF 解析库,而是 解析后端/底座 ——凭强大文档理解能力被直接调用(如 Zerox、GPTPDF 封装 Qwen/Gemini 作外挂 VLM),或嵌入 MinerU/PP-Structure 的数据构建管线。其优势是零样本泛化强,缺点是成本高、存在幻觉文本风险。
3.5.1 专用文档 VLM(端到端)¶
| 模型 | 规模 | 许可 | 关键特征 | 代表成绩 |
|---|---|---|---|---|
| PaddleOCR-VL-1.6 | 0.9B | Apache-2.0 | NaViT 动态分辨率 + ERNIE-4.5-0.3B,代码与权重均无商用限制,109 语种,支持异形框/印章/跨页 | OmniDocBench v1.6 96.33(小模型 SOTA,2026 Q3 被 OvisOCR2 96.58 / TeleOCR 96.87 超越) |
| HunyuanOCR | 1B | Tencent Hunyuan Community License(排除 EU/UK/韩国) | 中文文档优化 | OmniDocBench v1.6 94.74(HunyuanOCR-1.5) |
| MinerU2.5 | 1.2B | 权重需点协议 | 复杂版面鲁棒 | OmniDocBench v1.6 93.04(base)/ 95.75(Pro) |
| Dots.OCR → dots.mocr | 1.7B→3B | MIT | 图表→SVG 代码,多语 | olmOCR-Bench 83.9 |
| GOT-OCR 2.0 | 580M | 研究用途(原仓库)/ Apache-2.0(HF 卡,存争议) | 乐谱/分子式/几何图形多模态 | 边缘/低显存首选 |
| DeepSeek-OCR 2 / OCR2 | 3.39B(MoE) | MIT | ~100 语言,批量成本优 | 大规模批处理 |
| olmOCR | 7B | Apache-2.0 | GPT-4o 作为教师生成训练数据、Qwen2-VL-7B 作为学生基座微调,小 VLM 做 OCR | 英文学术文献 |
| Nougat | — | CC-BY-NC | 2023 LaTeX 还原先驱 | 历史基线(禁商用) |
3.5.2 通用 VLM 后端(非专为 OCR 设计)¶
| 模型 | 规模 | 许可 | 关键特征 |
|---|---|---|---|
| Qwen2.5-VL | 3B→72B | 权重 Apache-2.0(72B 超大规模需遵循 Qwen 社区许可) | DocVQA 95.7、QwenVL HTML 版面格式,中文文档首选后端之一 |
| InternVL2.5 | 多档 | — | 通用多模态,英文/通用 |
| GLM-4V-9B | 9B | 代码 Apache-2.0 / 权重 OpenRAIL-M | 1120×1120 端到端中文 OCR,允许商用(年营收<200 万美元初创免费,禁生成违法/歧视内容) |
| MiniCPM-V 2.6 | 8B(SigLip-400M + Qwen2-7B) | Apache-2.0 | OCRBench SOTA,端侧友好 |
4. 综合对比分析¶
4.1 第一梯队端到端系统对比(Docling / MinerU / Marker / PaddleOCR)¶
| 维度 | Docling | MinerU | Marker 2 | PaddleOCR/PP-StructureV3 |
|---|---|---|---|---|
| 范式 | Pipeline + 可选 VLM | Pipeline + MinerU2.5 VLM | Surya 套件编排 + 可选 LLM 精修 | Pipeline + PaddleOCR-VL |
| 版面模型 | RT-DETR / Heron | DocLayout-YOLO(PDF-Extract-Kit 为同团队工具包,可选 LayoutLMv3) | Surya 20M 快速版面 | PP-DocLayout 系列 |
| 表格 | TableFormer(金融强,FinTabNet TEDS>91%) | 强(跨页合并) | 基础(TEDS 约 75–80%,LLM 补强) | PP-TableMagic |
| 公式 | 一般(复杂嵌套弱) | 最强(UniMERNet,LaTeX,编号) | Surya LaTeX | PP-FormulaNet_plus |
| OCR | 可插拔 Tesseract/EasyOCR/RapidOCR | 内置 PaddleOCR | Surya OCR 2(~650M) | PP-OCRv6(单模型 50 语) |
| 输入格式 | 最广(PDF/DOCX/PPTX/XLSX/HTML/EPUB/邮件/音频) | PDF/图/DOCX | PDF/图/PPTX/DOCX/XLSX/HTML/EPUB | PDF/图 |
| 多语言 | 取决于 OCR 后端 | 109 语言,CJK 最强 | 90+(Surya) | 50 语统一 / VL 版 109 语 |
| 硬件 | 纯 CPU 可跑 | 高精度路径需 GPU(≥8GB) | CPU 可跑,批量需大 GPU(~3–5GB/worker) | CPU/GPU 均可,边缘 1.5M 起 |
| 许可证 | MIT(Granite Apache-2.0) | MinerU Open Source License(Apache-2.0 系,≥3.1.0 由 AGPLv3 切换) | 代码 Apache-2.0 + 权重 OpenRAIL-M($5M 门槛) | Apache-2.0(代码+权重无限制) |
| 治理 | LF AI & Data,IBM/Red Hat 背书 | 社区活跃,Star 最高 | Datalab 公司主导 | 百度开源,持续迭代 |
4.2 精度基准¶
本报告参考如下两个主流评测基准。注意各仓库自报分数存在“选择性打榜”现象(如 marker README 强调其领先 MinerU/docling,dots.ocr README 强调其超越 MinerU2.5),横向对比时应优先采用同一来源、同一版本的榜单数据,并以自有业务样本复测为最终依据。
| 基准 | 维护方 | 规模与构成 | 评测方式 | 备注 |
|---|---|---|---|---|
| OmniDocBench | OpenDataLab(上海 AI 实验室) | v1.0 含 981 页真实 PDF,覆盖 9 大文档类型、4 种布局类别、3 种语言,超 2 万个区域级标注;v1.5 进一步扩充 | 端到端整页解析 + 模块级(OCR/表格/公式/阅读顺序)双维度;采用 CDM(Content-Driven Matching)内容驱动匹配框架,降低空白/样式噪声影响 | 中英文档解析领域引用最广的基准之一,PP-StructureV3、MinerU2.5、PaddleOCR-VL、dots.ocr 等均在此打榜 |
| olmOCR-Bench | Allen Institute for AI(AI2) | 1,400+ 份 PDF、7,000+ 项单元测试,覆盖数学公式、表格、多栏、古旧扫描件、页眉页脚、超长小字等 8 类硬场景 | 单元测试式断言(文本存在性、属性、计数等),输出总分 | 由 olmOCR 团队发布,被 marker、dots.ocr、surya 等多家第三方主动引用对比 |
4.2.1 OmniDocBench v1.6¶
OmniDocBench(CVPR 2025,上海人工智能实验室 / OpenDataLab,arXiv:2412.07626)是当前文档解析选型的核心综合基准。其端到端 Overall(官方排行榜称 Accuracy,满分 100,越高越好)由三项子指标按固定权重合成:
Overall = ((1 − TextEditDist) × 100 + TableTEDS + FormulaCDM) / 3
- TextEditDist:纯文本归一化编辑距离(越低越好);
- TableTEDS:表格结构 TEDS 相似度;
- FormulaCDM:公式字符检测匹配 CDM。
本报告固定 OmniDocBench v1.6 为统一口径(截至 2026-09 公开最完整的官方排行榜版本;v1.6 引入 MGAM 多粒度自适应匹配与 296 页 Hard 子集)。
| 模型(版本) | 参数量 | Overall↑ (v1.6) | 备注 |
|---|---|---|---|
| TeleOCR | 1.2B | 96.87 | 阿里,2026 Q3 开源新 SOTA(arXiv:2608.12898) |
| OvisOCR2 | 0.8B | 96.58 | 阿里 ATH-MaaS,小模型 SOTA |
| PaddleOCR-VL-1.6 | 0.9B | 96.33 | 0.9B 小模型前列(已被上二者超越) |
| MinerU2.5-Pro | 1.2B | 95.75 | 数据为中心扩展版 |
| GLM-OCR | 0.9B | 95.22 | 智谱 |
| PaddleOCR-VL-1.5 | 0.9B | 94.93 | 上一版(v1.5/v1.6 归属存疑,见注) |
| HunyuanOCR-1.5 | 1B | 94.74 | 升级版 |
| PaddleOCR-VL | 0.9B | 94.18 | 初版 |
| Qianfan-OCR | 4B | 93.90 | |
| Youtu-Parsing | 2.5B | 93.74 | |
| Ovis2.6-30B-A3B | 30B | 93.70 | 通用 VLM |
| Logics-Parsing-v2 | 4B | 93.33 | |
| FireRed-OCR | 2B | 93.26 | |
| MinerU2.5 | 1.2B | 93.04 | 基础版(本报告主引用) |
| dots.ocr | 3B | 90.77 | |
| OpenDoc-0.1B | 0.1B | 90.67 | |
| DeepSeek-OCR 2 | 3.39B(MoE) | 90.25 | |
| HunyuanOCR | 1B | 89.95 | 基础版(v1.5 口径曾报 94.1) |
| olmOCR | 7B | 85.74 | GPT-4o 教师蒸馏 |
| Mistral OCR (API) | — | 85.66 | 商业 API 参照 |
数据出处:OmniDocBench 官方排行榜
github.com/opendatalab/OmniDocBench(Papers With Code / CodeSOTA 镜像),经 arXiv:2606.03264 与 arXiv:2608.12898v3 两篇 2026 论文交叉校验(TeleOCR 96.87、OvisOCR2 96.58 等 2026 Q3 新模型已纳入表中)。所有数字为厂商/论文自报,建议以自有样本 POC 复测为最终裁决。
4.2.2 olmOCR-Bench¶
Allen AI 第三方基准,1,403 份 PDF、8 类子集 macro-average(越高越好)。数字取自 olmOCR 仓库与 dots.ocr 仓库,两源完全一致。
| 模型(版本) | Overall | 说明 |
|---|---|---|
| Mistral OCR (API) | 72.0 | 商业 API 参照 |
| MinerU 2.5.4* | 75.2 | 端到端 |
| DeepSeek-OCR (3B) | 75.7 | |
| Marker 1.10.1 | 76.1 | balanced 路径 |
| dots.ocr (1.7B) | 79.1 | |
| PaddleOCR-VL* (0.9B) | 80.0 | 小模型高调位 |
| olmOCR v0.4.0 (7B) | 82.4 | GPT-4o 教师蒸馏 |
| Surya OCR 2 | 83.3 | Surya 模型栈新版 |
| dots.mocr (3B) | 83.9 | 公实数值准确 |
| Chandra 2(Datalab) | 85.8–85.9 | Datalab 旗舰模型(2026) |
| Nanonets OCR-3 | 87.4 | 商业/开源混合 |
| Infinity-Parser2-Pro | 87.6 |
星标(*)为各仓库官方复测版本。结论:dots.mocr 83.9 公实数值准确,但 2026 年已被 Chandra 2(85.8–85.9)、Infinity-Parser2-Pro(87.6)、Nanonets OCR-3(87.4) 等超越,“开源 SOTA 区间”说法已不成立;Surya OCR 2 自身为 83.3。端到端小模型已逼近甚至超过部分商业 API。
4.3 许可证与商用矩阵¶
PDF 文档解析系统的许可证分「代码许可」与「权重许可」两层——代码开源 ≠ 权重可商用,商用前须逐一核对仓库 LICENSE 与模型卡。
| 项目 | 代码许可 | 权重许可 | 商用注意点 |
|---|---|---|---|
| MinerU | Apache-2.0 系 | MinerU Open Source License(附加商业条款) | ≥3.1.0 由 AGPLv3 切换;超 100M MAU 或 $20M/月营收需商业授权,在线服务须标明 |
| Marker / Surya | Apache-2.0 | 修改版 AI Pubs OpenRAIL-M | 融资/营收 ≥$5M 企业商用需付费授权 |
| Docling | MIT | MIT(GraniteDocling 等以模型卡为准) | 无显著门槛 |
| PaddleOCR(含 PP-StructureV3) | Apache-2.0 | Apache-2.0 | 无显著门槛 |
| PaddleOCR-VL | Apache-2.0 | Apache-2.0 | 无显著门槛 |
| olmOCR | Apache-2.0 | Apache-2.0 | 无显著门槛 |
| Unstructured | Apache-2.0 | — | 开源库与付费云 API 功能有差异 |
| dots.ocr / dots.mocr | MIT | MIT | 无显著门槛 |
| DeepSeek-OCR 2 | MIT | MIT | 无显著门槛 |
| GOT-OCR 2.0 | Apache-2.0 | Apache-2.0 | 注:原仓库标"研究用途",HF 卡为 Apache-2.0,口径存异,商用前核对 |
| HunyuanOCR | Tencent Hunyuan Community License | 同左(排除 EU/UK/韩国) | 商用须评估地域排除条款 |
| DocLayout-YOLO | AGPL-3.0 | 以仓库为准 | SaaS/闭源集成有传染风险 |
| PDF-Extract-Kit | AGPL-3.0 | 组件各异 | 同上,且组件许可需逐个核对 |
| LayoutLMv3 | MIT(代码) | CC-BY-NC-SA 4.0(非商业) | 权重不可商用 |
| MarkItDown | MIT | — | PDF 底座 PyMuPDF 为 AGPL,深度集成需评估 |
| PyMuPDF | AGPL-3.0 / 商业双授权 | — | 闭源产品需购买商业许可 |
| pdfplumber / pdfminer.six / Tesseract / EasyOCR / RapidOCR | MIT / MIT / Apache-2.0 / Apache-2.0 / Apache-2.0 | 同左 | 无显著门槛 |
4.4 选型决策树¶
- 文档是否含扫描/图片且无文本层?是 → 先 OCR(PaddleOCR 中文 / Tesseract 离线 / HunyuanOCR);否 → 进入 2。
- 中文技术文档 / 公式密集 / 表格多?→ MinerU。
- 多格式(PDF+Office+HTML)企业 RAG / 强合规离线?→ Docling(MIT,纯 CPU,气隙部署)。
- 快速转 Markdown、代码 Apache-2.0 友好?→ Marker(注意权重 AI Pubs OpenRAIL-M 的 $5M 商用门槛)。
- 仅提取规则表格?→ Camelot / pdfplumber。
- 纯文本快速抽取?→ PyMuPDF4LLM / pdfplumber。
- 轻量端到端 / 消费级 GPU?→ HunyuanOCR / Dots.OCR / GOT-OCR 2.0。
- 已具备 GPU 与工程能力、想要自研解析后端?→ Qwen2.5-VL / InternVL2.5 / GLM-4V-9B / MiniCPM-V 2.6,同一模型兼顾解析与 RAG 问答,且可避开 AGPL 约束。
- 发票/表单字段抽取(中文)?→ PP-ChatOCRv4 / Donut。
5. 总结¶
PDF 解析已从“文本抽取”进化为“文档智能”。开源生态在 2024–2026 年完成关键跃迁:以 MinerU、Docling、Marker 为代表的综合平台,结合 PaddleOCR、HunyuanOCR、Dots.OCR、GOT-OCR 2.0 等识别引擎,以及 Camelot、pdfplumber、LayoutParser、PP-Structure 等专项工具,已能覆盖 OCR、版面分析、信息提取与格式转换的全链路需求,并在多个基准上逼近甚至超过商业 API。
2026 年形成清晰的“三超 + 一厂”格局:MinerU 在表格/公式/CJK 维度综合最强(但 OmniDocBench Overall 已被 PaddleOCR-VL-1.6/TeleOCR/OvisOCR2 超越)、Marker 轻量转 Markdown 场景采用广(但权重许可证构成商用门槛,且 GitHub Star 约 39.8k 低于 MinerU 80.2k 与 Docling 66.6k)、Docling 覆盖面与合规性最强(MIT + 纯 CPU + 企业治理)、PaddleOCR 以 Apache-2.0 全栈 + 中文主场 + 0.9B 小模型高调位成为许可证敏感型企业的最优解(GitHub 79k+ 已超越 Tesseract)。经典工具(PyMuPDF/pdfplumber/Camelot)在规则化数字原生文档上仍是成本最低方案。
关键技术趋势如下:
-
VLM 端到端成为主流:Nougat→GOT-OCR 2.0→HunyuanOCR→Dots.OCR→MinerU 2.5 表明,单次前向推理统一检测/识别/版面/表格/公式/翻译,正系统性替代级联流水线。
-
VLM 小型化竞赛:1.2B 的 MinerU2.5、0.9B 的 PaddleOCR-VL、258M 的 Granite-Docling 相继刷榜,证明分辨率工程 > 参数堆叠成为新范式,端侧/CPU 部署边界不断下移。
-
双后端成为标配:管线(低成本兜底)+ VLM(高精度攻坚)二元架构 + 级联策略,是 2026 年生产系统主流拓扑。
-
多模态融合与结构化输出:公式→LaTeX、表格→HTML、流程图→Mermaid、图表→SVG(dots.mocr),输出从纯文本走向机器可读结构化对象。
-
Agent / MCP 原生集成:MinerU、Docling、Unstructured 均已支持 MCP 与主流 Agent 框架;Docling 已有 OpenShift Operator,解析从”库”推向“服务”。
附录 A 项目索引¶
| 名称 | GitHub / 主页 |
|---|---|
| MinerU | github.com/opendatalab/MinerU |
| Docling | github.com/docling-project/docling |
| Marker | github.com/datalab-to/marker |
| olmOCR | github.com/allenai/olmocr |
| Unstructured | github.com/Unstructured-IO/unstructured |
| DeepDoctection | github.com/deepdoctection/deepdoctection |
| DocXChain | github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/Applications/DocXChain |
| Tesseract | github.com/tesseract-ocr/tesseract |
| PaddleOCR | github.com/PaddlePaddle/PaddleOCR |
| EasyOCR | github.com/JaidedAI/EasyOCR |
| Surya | github.com/VikParuchuri/surya |
| GOT-OCR 2.0 | github.com/Ucas-HaoranWei/GOT-OCR2.0 |
| HunyuanOCR | github.com/Tencent/llm.hunyuan.ocr |
| Dots.OCR | github.com/rednote-hilab/dots.ocr |
| LayoutParser | github.com/Layout-Parser/layout-parser |
| PP-Structure | github.com/PaddlePaddle/PaddleOCR |
| 360LayoutAnalysis | github.com/360AIResearch/360LayoutAnalysis |
| Camelot | github.com/camelot-dev/camelot |
| Tabula | github.com/tabulapdf/tabula |
| pdfplumber | github.com/jsvine/pdfplumber |
| TableTransformer | github.com/microsoft/table-transformer |
| PDFMiner.six | github.com/pdfminer/pdfminer.six |
| PyMuPDF / 4LLM | github.com/pymupdf/PyMuPDF |
| markitdown | github.com/microsoft/markitdown |
| Nougat | github.com/facebookresearch/nougat |
| pdf-craft | github.com/oomol-lab/pdf-craft |
| pandoc | pandoc.org |
| SmolDocling | github.com/docling-project/smoldocling |
| Parxy | 统一多解析器 API 网关 |
| StructEqTable-Deploy | github.com/UniModal4Reasoning/StructEqTable-Deploy |
| chunkr | github.com/lumina-ai-inc/chunkr |
附录 B 参考资料¶
- Livathinos et al., Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion, arXiv:2501.17887(IBM 官方技术报告与基准)
- Cui et al., PaddleOCR 3.0 Technical Report, arXiv:2507.05595(PP-StructureV3 五模块架构)
- A Comparative Study of PDF Parsing Tools Across Diverse Document Categories, arXiv:2410.09871(DocLayNet 十工具对比)
- PaddleX / PaddleOCR 官方文档:PP-StructureV3、PP-DocLayoutV2 阅读顺序机制
- Camelot 官方对比文档(2026-05 版,与 Tabula/pdfplumber/PyMuPDF/unstructured 逐项对比);camelot-dev/camelot v2.0.0 发布说明(2026)
- olmOCR-Bench(Ai2)、OmniDocBench(CVPR 2025,arXiv:2412.07626)公开榜单及 2026 年第三方复测报道
- pdfmarkdownapp/pdf-to-markdown-benchmark(MIT,公开答案键与缺陷账本)
- "Docling vs Marker vs MinerU: The Ultimate Open-Source PDF Parser Benchmark (2026)", Aditya Mangal(含可复现评测脚本与许可分析)
- Datalab, Marker 2 发布与 olmOCR-bench 对比(2026-07);Best Open-Source OCR Models 2026 (Compared)(2026-08 更新);Chandra 2 旗舰 OCR 模型(olmOCR-Bench 85.8–85.9)
- HunyuanOCR 技术报告, arXiv:2607.04884(331 语种;OmniDocBench v1.6 94.74)
- TeleOCR, arXiv:2608.12898(OmniDocBench v1.6 96.87,2026 Q3 开源 SOTA)
- OvisOCR2(阿里 ATH-MaaS,OmniDocBench v1.6 96.58);MinerU 3.4/4.0 发布说明(2026-06 / 2026 后续,GitHub opendatalab/MinerU)
本报告由 Kimi2.7、Qwen3.8-max、Hunyuan3、DeepSeek-v4.1-flash、Claude Opus 5 基于公开技术资料、官方仓库、技术博客与 2025–2026 年公开基准整理,数据截至 2026-09。具体版本能力与许可证以各项目官方仓库最新声明为准。