2026 开源 PDF 解析库全景:从文本抽取到文档智能

发布于:2026-09-19 | 分类:document analysis


最近使用 Claude Opus 5 将一份扫描的PDF合同转换为markdown,惊异于圆形公章上公司名及手写签名都能正确识别,心血来潮想看看开源领域 PDF 文档解析库的发展状态。于是经过 Kimi2.7、Qwen3.8-max 起草初稿、WorkBuddy 内置 Hunyuan 3 整理及 13 版修订、DeepSeek-v4.1-flash、Claude Opus 5 最终审核,生产了本文调研报告。

区别于 Python处理PDF的第三方库对比 关注对 PDF 文档本身的操作能力如提取/创建内容、增删页面等,本报告更偏向文档理解——语义级别的内容提取。

PDF 作为事实上的“电子纸张”标准,承载了海量的论文、合同、财报、研报与档案。然而 PDF 本质是面向“打印排版”的格式,而非结构化数据格式,文本、表格、公式、图片混杂,多栏、跨页、扫描件、水印等情形进一步加剧了机器理解的难度。随着 RAG(检索增强生成)、大模型训练语料构建、企业知识库与 Agent 工作流的兴起,对 PDF 高质量、结构化解析 的需求从“能读出字”升级为“能还原版式、表格、公式与阅读顺序”。

在合规(HIPAA / GDPR / 数据不出域)、成本(商业 API 按页计费,规模化后昂贵)与可控性(可微调、可私有化部署)三重驱动下,自托管开源方案成为企业级文档智能的可行乃至必选路径。而在纯离线/涉密场景,开源是唯一合规选项。因此,本报告围绕开源方案展开,按 OCR(光学字符识别)、版面分析、信息提取 三大理解能力维度,对 40+ 个主流开源库进行系统化梳理;其中信息提取细分为 信息抽取(结构化字段)、表格提取、公式提取 三类子任务。

本报告重点调研了 MinerU、Docling、Marker、olmOCR、Unstructured、DeepDoctection、DocXChain 等综合平台,Tesseract / PaddleOCR / EasyOCR / Surya / GOT-OCR 2.0 / HunyuanOCR / Dots.OCR 等识别引擎,以及 Camelot / Tabula / pdfplumber / TableTransformer 等表格与文本提取工具。报告给出精度基准对比,并总结以视觉语言模型(VLM)端到端为代表的下一代技术趋势。此外,针对通用视觉语言模型(VLM)作为解析后端,系统梳理了 PaddleOCR-VL、Qwen2.5-VL、InternVL2.5、GLM-4V-9B、MiniCPM-V 2.6、DeepSeek-OCR 等以 VLM 为底座的文档解析方案。

核心结论:

  • 中文团队主导创新节奏,中文生态居全球第一梯队:MinerU(80.2k★)、PaddleOCR(79k+★)、dots.ocr(小红书)、DeepSeek-OCR、GOT-OCR 2.0(阶跃星辰)等头部项目多来自中国团队,中文文档/公式/表格场景适配红利显著;OmniDocBench、olmOCR-Bench 等公开基准长期由中文项目占据前列。

  • 技术范式已分化为“Pipeline 模块化”与“VLM 端到端”两派,且头部项目均已融合:2026 年实际格局是“管线(低成本兜底)+ VLM(高精度攻坚)”双后端并存,配合“默认快路径、低置信升级重路径”的级联策略。

  • 精度维度:PaddleOCR-VL-1.6(0.9B 小模型,OmniDocBench v1.6 96.33 居小模型前列,2026 Q3 起已被 OvisOCR2 96.58 / TeleOCR 96.87 超越)与 MinerU2.5-Pro(95.75)同处第一梯队。

  • 选型无单一赢家,须按场景匹配:追求中文文档与公式/表格精度选 MinerU 或 PaddleOCR;追求工程集成与多格式统一表示选 Docling;追求 CPU 轻量部署选 Marker(fast)或 PP-OCRv5 mobile;追求极致精度且有 GPU 选 dots.mocr / olmOCR / DeepSeek-OCR;面向 LLM/RAG 数据流水线选 Unstructured 与前述解析器组合。

  • 许可证与部署维度:Docling(MIT、65+ 格式、可纯 CPU 运行)与 PaddleOCR(Apache-2.0,代码与权重均无商用限制)最宽松;MinerU(≥3.1.0 转 Apache-2.0 系 MinerU Open Source License)与 Marker(代码 Apache-2.0)2026 年也已大幅放宽,但二者模型权重仍设营收/融资门槛;Nougat 与 LayoutLMv3 权重 CC-BY-NC / CC BY-NC-SA 4.0,禁商用

1. PDF 文档解析的挑战与技术演进

一个完整的 PDF 解析系统通常需协同解决下表所示子任务。传统工具(如 pdftotext)在真实文档上暴露出典型失效:公式丢失或乱码;表格结构崩坏;图片被忽略;页眉页脚混入正文、段落被随意切割;多栏布局下阅读顺序错乱。其根源在于 PDF 不保存语义结构,仅保存绘制指令如字符、线段、图像的位置与样式。

更细分的难点包括:数字原生 PDF(含文本层)vs 扫描版/图层型 PDF(文字不可复制、乱码);有线表格(lattice)vs 无线/白隙表格(stream);合并单元格、跨页表格、嵌套表头;行内/行间公式;旋转版面与页眉页脚去噪;竖排文字、印章、手写等等。

任何单一方案都难以覆盖全部长尾情形。

子任务 说明 典型难点
版面/布局检测 定位标题、正文、图、表、公式、印章等区域 多栏、图文混排、旋转、密集表格
阅读顺序恢复 按人类阅读顺序串联区域 多栏论文、报纸、教材
OCR 文字识别 图像文字 → 字符序列 多语言、手写体、低质扫描件
表格识别 还原行/列/单元格结构 无线表、合并单元格、跨页表
公式识别 印刷/手写公式 → LaTeX 嵌套结构、行内公式
页眉页脚/水印剔除 去除与正文无关的重复元素 与正文的区分
关键信息提取(KIE) 抽取字段级语义(金额、日期、甲乙方等) 版式多样性、少样本适应

为了解决上述难点,PDF 文档解析技术经历了从 OCR 到文档智能的演进。

  • 传统 ML 引擎(Tesseract v4+ LSTM):CPU 友好、成熟稳定,但弱于版面与手写;
  • 深度学习检测-识别级联(PaddleOCR、EasyOCR、Surya):检测(DBNet/PP-YOLO)+ 识别(CRNN/SVTR)+ 版面(LayoutParser/PP-Structure),精度大幅提升;
  • 端到端视觉语言模型(VLM)(Nougat、GOT-OCR 2.0、HunyuanOCR、Dots.OCR、olmOCR、MinerU 2.5 内置 VLM):单次前向推理直接输出结构化文本/公式/表格,消除级联误差累积,成为 2025 年后的主流方向。
  • 通用 VLM 作为解析后端(Qwen2.5-VL、InternVL2.5、GLM-4V-9B、MiniCPM-V 2.6):并非专门的 PDF 解析器,但凭强大文档理解/定位能力被广泛封装为自研解析服务,或嵌入 MinerU/PP-Structure 的数据构建管线,是 VLM 范式在工程侧的延伸。

2. 技术体系与能力分类

2.1 技术路线的两大范式

据公开资料,PDF 文档解析范式可以归为两类。2026 年头部项目已呈融合态势,例如 Docling 增加 Granite-Docling-258M VLM 路径;MinerU 同时保留经典管线后端供纯 CPU 场景;Marker 2 定位为Surya 模型套件的编排器,其质量上限即 Surya 的质量上限。

范式 原理 代表 优点 缺点
Pipeline 模块化 检测/识别/版面/表格/公式各用专用模型,串行组装 Docling、PaddleOCR PP-StructureV3、Marker(Surya 套件)、MinerU 管线后端 可解释、可替换单模块、易私有化微调、CPU 可跑 误差级联、工程复杂
VLM 端到端 单模型直接"看图吐 Markdown/JSON" MinerU2.5、PaddleOCR-VL、Marker 2、Granite-Docling、GPTPDF、Zerox、olmOCR 复杂版面鲁棒、训练成本外置 推理开销大、依赖 GPU、黑盒

2.2 按功能维度分类

PDF 解析的理解能力归为 OCR、版面分析、信息提取三大维度;信息提取细分为三类子任务(见下表)。

能力维度 解决的问题 代表性开源库
OCR(文字识别) 扫描件/图片/乱码 PDF 的文本抽取,含多语种、手写 Tesseract、PaddleOCR、EasyOCR、Surya、GOT-OCR 2.0、HunyuanOCR、Dots.OCR
版面分析(Layout) 区分标题/正文/表格/图片/公式区域,还原阅读顺序与层级 LayoutParser、PP-Structure、360LayoutAnalysis、DocLayout-YOLO、DocLayNet(Docling)、PDF-Extract-Kit(MinerU 同团队工具包,含 DocLayout-YOLO / YOLO-v10 / LayoutLMv3 可选)
信息提取(IE) 从文档中抽取结构化信息(含三类子任务,统一见 3.4:3.4.1 表格 / 3.4.2 公式 / 3.4.3 KIE)

信息提取的三类子任务:

子任务 解决的问题 代表性开源库
信息抽取(KIE) 从票据/合同/表单抽取关键字段与实体关系 PP-ChatOCR、Unstructured、DeepDoctection、DocXChain、GLM-OCR、HunyuanOCR(开放字段)
表格提取(Table) 有线/无线/跨页/合并单元格表格的结构化重建 Camelot、Tabula、pdfplumber、TableTransformer、gmft、StructEqTable
公式提取(Formula) 行内/行间公式识别为 LaTeX / MathML UniMERNet、PP-FormulaNet、Surya LaTeX、Nougat、GOT-OCR 2.0

:上表「信息提取三类子任务」列出的是 专用/代表性工具;需强调,端到端文档解析系统(MinerU / Docling / Marker / olmOCR 等)同样内置表格提取、公式识别与 KIE 能力——二者并非互斥关系。

选型时,若只需拆出单张表/单个字段,用专用工具(Camelot、pdfplumber、PP-ChatOCR)即可;若需全文档结构化 + 阅读顺序 + 多格式输出,则端到端平台更合适。

3. 主流开源库

3.1 综合型文档解析平台

MinerU(OpenDataLab / 上海人工智能实验室) OCR·版面·表格·转换

  • 仓库opendatalab/MinerU许可证:MinerU Open Source License(基于 Apache-2.0 的自定义许可;≥3.1.0 由 AGPLv3 切换,超 100M MAU 或 $20M/月营收需商业授权、对外在线服务须标明);活跃度:约 80.2k★(2026-09)。
  • 定位:将 PDF、图片及 Office 文档转换为 LLM-Ready 的 Markdown / JSON 的高精度解析工具,中文社区事实标杆。
  • 核心能力:去页眉/页脚/页码/脚注、还原多栏阅读顺序;OCR 约 109 种语言;公式检测+识别输出 LaTeX;表格识别输出 HTML/OTSL;自动提取图片并引用;输出 Markdown、middle-json、model-json 多层结构化格式;4.0 引入质量四档(flash/basic/standard/advanced)、本地文档库、面向 Agent 的 CLI(按页/块续读、稳定定位符 locator)。
  • 技术架构:双后端——传统 pipeline 后端(版面检测+公式/表格/OCR 专用模型级联,小模型 ONNX CPU 推理)与 VLM 后端(MinerU2.x/2.5 系列 1.2B,llama.cpp + Vulkan,NVIDIA GPU 可装 mineru[full] 用 vLLM/lmdeploy 提吞吐)。
  • 性能参考:OmniDocBench v1.6:MinerU2.5 93.04 / MinerU2.5-Pro 95.75(同规模组榜首);olmOCR-Bench 75.2(2.5.4)。2026 年陆续发布 3.4(2026-06-18,pipeline 换 PP-OCRv6,较 2.5 +11%)、4.0(四档 tier、9 种渲染输出、本地文档库)。
  • 部署要求:Python 3.10–3.14;默认 CPU 可跑,GPU 大幅提吞吐;支持 Windows/macOS/Linux。
  • 小结:中文文档、学术论文(公式/表格密集)首选之一;生态成熟、与主流 RAG 框架集成广。注意点:附加商业条款、VLM 后端显存需求。

Docling(IBM Research → LF AI & Data 基金会) 版面·表格·转换

  • 仓库docling-project/docling许可证:MIT(宽松,无权重商用门槛);活跃度:约 66.6k★(2026)。
  • 定位:"Get your documents ready for gen AI"——面向生成式 AI 的统一文档处理框架。
  • 核心能力:输入格式覆盖最广(PDF/DOCX/PPTX/XLSX/HTML/EPUB/邮件/音视频/XBRL 等);DocLayNet 版面 + TableFormer 表格重建(FinTabNet TEDS>91%)+ 多引擎 OCR;元数据提取(标题/作者/参考文献/语言);统一中间表示 DoclingDocument,导出 Markdown/HTML/JSON/DocTags/WebVTT;--pipeline vlm(GraniteDocling 258M,Apache-2.0);LangChain/LlamaIndex/CrewAI/Haystack 官方集成、MCP Server、docling-serve。
  • 性能参考:olmOCR-Bench 50.3%(数字版子集 64.0%),强项不在卷 OCR 精度而在格式覆盖与生态集成。
  • 部署要求:Python 3.10+;CPU 可跑、GPU 可选;支持完全本地/离线(air-gapped)。
  • 小结:MIT + 基金会治理 + IBM 背书,企业级多格式文档 ETL 与 RAG 集成稳健选择;中文公式/手写极限精度弱于 MinerU、PaddleOCR。注意:PDF→DOCX 排版级还原非其目标。

Marker(Datalab) OCR·版面·转换

  • 仓库datalab-to/marker许可证:代码 Apache-2.0 + 权重 AI Pubs OpenRAIL-M(研究/个人/初创 <$5M 营收或融资免费,超出需购商业授权);活跃度:约 39.8k★(2026)。
  • 定位:快速、高精度地将文档转换为 Markdown / JSON / chunks / HTML。
  • 核心能力:输入 PDF/图/PPTX/DOCX/XLSX/HTML/EPUB,全语言;输出 Markdown/JSON/RAG chunks/HTML;表格/表单/公式/链接/引用/代码块格式化;--use_llm 可选接 LLM 做跨页表合并、表单值抽取、行内公式修复;架构可扩展。
  • 技术架构:深度学习流水线,核心依赖同门 Surya 模型族——balanced 模式用 Surya VLM 做版面+行内公式 OCR+坏页重识别;fast 模式用 rf-detr 版面 + pdftext 文本层提取,仅对公式与损坏块做 VLM 点状修复,纯数字文档可完全绕开 VLM,CPU 友好。2026-07 发布重写版 Marker 2(Surya OCR 2 ~650M、20M 快速版面、pdftext 快约 3×;结构化抽取 converter 移除,改 --use_llm/托管 API)。
  • 性能参考:olmOCR-Bench balanced 76.0%(数字版 83.5%);dots.ocr 仓库引用 Marker 1.10.1 为 76.1。
  • 部署要求:Python 3.10+;GPU/CPU/MPS 均可;balanced 需 vLLM(NVIDIA)或 llama.cpp。
  • 小结:速度精度平衡好、多格式齐全、RAG 友好;最大风险是权重商用许可门槛(融资/营收超 $5M 需付费)。同公司另有旗舰 Chandra 2(olmOCR-Bench 85.8–85.9,高于 dots.mocr 83.9),评估 Datalab 生态应以 Chandra 2 为质量锚点。

PaddleOCR 3.x(百度飞桨) OCR·版面·表格·转换

  • 仓库PaddlePaddle/PaddleOCR许可证:Apache-2.0(代码与权重均无商用限制);活跃度:79k+★(2026-09,用户遍布 160 国)。
  • 定位:从经典 OCR 工具包升级为“OCR + 文档解析 + 文档理解”三位一体体系,三大核心方案:
  • PP-OCRv5(文字识别):单模型统一简/繁/拼音/英/日,server / mobile 双版本(mobile 面向纯 CPU 与端侧);
  • PP-StructureV3(文档解析):PP-DocLayout 版面 + 表格/公式(PP-FormulaNet)/图表(PP-Chart2Table)/印章/阅读顺序一体化,“一键输出 JSON + Markdown”,支持 Word/docx 输出;
  • PP-ChatOCRv4-doc(KIE):轻量 OCR 与 ERNIE-4.5、PP-DocBee2(3B 多模态)RAG 融合,关键信息抽取端到端 Recall@1 85.55%(官方自报,称超 GPT-4o 22 个百分点)。
  • 配套:PaddleOCR-VL(0.9B VLM,见 3.5);训练/推理/部署工具链完整,支持昆仑芯、昇腾等国产硬件异构加速。
  • 小结:中文场景综合最强全家桶,从端侧 mobile 到服务器级 VLM 全覆盖,Apache-2.0 无商用顾虑;代价是绑定 PaddlePaddle 框架,组件繁多、上手略陡。

olmOCR(Allen Institute for AI) OCR·版面

  • 仓库allenai/olmocr许可证:Apache-2.0(代码与权重均宽松)。
  • 定位:PDF 大规模“线性化”(转 Markdown/纯文本)工具链,主打 LLM 训练/RAG 高质量语料。
  • 核心能力:直接处理 PDF 原文(正文/标题/章节/表格/公式/手写),清除页眉/页脚/水印,保留元数据,输出干净 Markdown;成本主张鲜明(每百万页 <$200,官方口径);基于 Qwen2-VL 系微调(7B 级),vLLM 推理;olmOCR 2 引入 Unit Test Rewards(RL 奖励);副产品 olmOCR-Bench 成行业通用基准。
  • 性能参考:olmOCR v0.4.0 在 olmOCR-Bench 总分 82.4(dots.ocr 仓库引用),高于 marker(76.1)与 MinerU 2.5.4(75.2)。
  • 部署要求:Python + vLLM;本地 GPU / Docker / AWS S3 集群均可;7B 模型对显存有要求(常 A100/H100 + vLLM)。
  • 小结:许可最宽松、面向海量页级批处理的 VLM 方案,学术背书、评测透明;小规模单位成本高于 1B 级专用小模型。

Unstructured(Unstructured.io) 版面·提取·转换

  • 仓库Unstructured-IO/unstructured许可证:Apache-2.0(open-core,LICENSE 核验)。
  • 定位:非结构化数据 ETL 库——不做最强解析,做最通用元素化切分,是 RAG/LLM 数据管道事实标准组件之一。
  • 核心能力partition 系列 API 将 PDF/DOCX/PPTX/HTML/EML/图等 20+ 格式统一切分为带类型标签元素(Title/NarrativeText/Table/ListItem 等)并附页码/坐标;fast(文本层)/hi_res(版面+OCR)/ocr_only/auto 多策略;内置 chunking、清洗、staging(JSON/CSV/DataFrame);与 LangChain、LlamaIndex 深度集成;可 Docker 化。
  • 小结:以信息提取 + 数据管道见长;表格/公式极限还原不如 MinerU、PaddleOCR 等专业解析器。常见组合:Unstructured 做统一元素层,专业解析器做 PDF 深度解析。

其他值得关注

  • PDF-Extract-Kit(OpenDataLab 高质量抽取工具箱,AGPL-3.0)
  • DeepDoctection(Detectron2 全家桶,RAG 场景)
  • DocXChain(阿里达摩院模块化工具链,中英开箱)
  • Chandra / Chandra 2(Datalab 旗舰模型,olmOCR-Bench 85.8–85.9)
  • MonkeyOCR-pro-3B(华科,Elo 781.1)
  • HunyuanOCR(腾讯,331 语种,Tencent Hunyuan Community License)
  • GLM-OCR(智谱,0.9B)
  • SmolDocling / GraniteDocling(超小 VLM,DocTags)
  • Infinity-Parser(olmOCR-Bench 82.5+)
  • omniparse / open-parse / chunkr(视觉模型驱动分块)
  • pdf-extract-api(OCR+Ollama,匿名化/去 PII)
  • MarkItDown(微软“任意文件→Markdown”胶水层,MIT)
  • Parxy(统一 API 网关,多解析器 A/B 与灰度切换)

3.2 文本获取:底层文本抽取与 OCR 识别

把 PDF 中的文字“取出来”有两条互补路径:数字原生 PDF 自带文本层(直接读取即可,无需识别),扫描/图片 PDF 则需 OCR 识别。二者均属最底层的文本获取,区别于语义级的信息提取。

3.2.1 底层文本抽取(数字原生 PDF 文本层)

工具 许可证 文本 备注
PDFMiner.six MIT 底层文本/坐标提取,众多库的基础
PyMuPDF (fitz) AGPL-3.0 快/优 渲染级高速文本抽取,无 OCR/版面;RAG 轻量管线常用
pdfplumber MIT 字符/线/曲线级精细控制,调试首选
PyMuPDF4LLM AGPL-3.0 在 PyMuPDF 上叠加 Markdown 输出

数字原生 PDF 应直接读文本层而非逐页 OCR(Docling 官方称快 30×);PyMuPDF / pdfplumber 在 CPU 上单页仅个位数毫秒。文本层不含阅读顺序、分栏、表格单元格概念,本质是“带坐标的字形袋”。

3.2.2 OCR 识别引擎(扫描件/图片/乱码 PDF)

引擎 许可证 语种 参数量/规模 核心特点 最佳场景
Tesseract Apache-2.0 100+ LSTM、CPU 优先、生态最成熟;版面分析能力弱(仅 PSM 页面分割模式,无结构化输出) 多语种印刷体批量数字化、离线
PaddleOCR / PP-OCRv6 Apache-2.0 100+ tiny 1.5M / medium 34.5M / server 2026-06 发布,DB++ 检测 + SVTR_LCNet 识别,OpenVINO 在 Intel CPU 约 5.2×、M4 约 6.1× 加速;PP-StructureV3 复杂文档解析;GitHub 79k+ Star(已超越 Tesseract) 中文政务/金融/产业级、边缘
EasyOCR Apache-2.0 80+ PyTorch、API 极简、抗干扰强;无表格/版面模块 多语种轻量快速原型
Surya 代码 Apache-2.0;权重 Modified AI Pubs OpenRAIL-M(<$5M 免费,旧 CC-BY-NC-SA 4.0) 90+ 650M(识别模型单体) Transformer,复杂/旋转表格识别强,含阅读顺序 财务/学术多栏复杂文档(Marker 2 底座)
GOT-OCR 2.0 研究用途(原仓库)/ Apache-2.0(HF 卡,存争议) 50+ 580M 阶跃星辰,端到端 VLM(ViTDet + Qwen-0.5B),统一文本/公式/图表/乐谱/分子式,显存 <3GB 科技文献/结构化文档、低显存
HunyuanOCR Tencent Hunyuan Community License(排除 EU/UK/韩国) 331(arXiv:2607.04884) 1B 腾讯端到端 VLM,OmniDocBench v1.6 94.74(HunyuanOCR-1.5)、OCRBench 860 轻量 SOTA、消费级 GPU
Dots.OCR → dots.mocr MIT 100+ 1.7B → 3B 小红书 hi-lab VLM,统一版面+内容,比 GPT-4o/Gemini 快 10×;独特支持图表→SVG 代码;olmOCR-Bench 83.9 复杂多语种文档、图表矢量重建
Dolphin Apache-2.0 50+ 400M+ 先分析后解析复杂版面 复杂版面文档
GLM-OCR MIT 30+ 0.9B 智谱,支持 schema 引导 JSON 结构化输出,Ollama 可部署 中文 KIE/字段抽取、学术内容
DeepSeek-OCR 2 MIT 30+ 3.39B(MoE) 中英文档,MoE 降低单页推理成本 中英文档、批量云管线
Baidu Unlimited-OCR MIT 40+ 3B 多页 PDF 单次通过、HTML+LaTeX 结构化输出 多页结构化批量
LightOnOCR-2 Apache-2.0 20+ 1B 法语/欧洲语种优化 法语/欧洲语种
Florence-2 MIT 100+ 770M 通用视觉任务基座 通用视觉+OCR 组合场景

关于手写识别的定性结论:Surya 在开源方案中综合最佳,Nougat 手写尚可,Tesseract 在 CPU 上极快但手写弱;超大模型 Qwen2.5-VL-72B 手写最强。

3.3 版面分析专用

  • LayoutParser(Zejiang Shen 等,Allen Institute for AI / Brown / Harvard / UW / Waterloo,arXiv:2103.15348):基于 Detectron2(Meta)等可插拔后端的文档图像分析工具箱,内置学术论文/报纸/表格预训练模型,准确率 90%+。

  • PP-Structure / PP-StructureV3(PaddleOCR 团队):五模块架构(预处理→OCR→版面→文档项识别→后处理)。版面分析用 PP-DocLayoutV2——在 PP-DocLayout_plus-L(RT-DETR-L)之上级联 6 层 Transformer 轻量指针网络;检测框与类别经绝对二维位置编码嵌入,注意力引入 Relation-DETR 几何偏置建模元素间成对几何关系,由成对关系头产生 N×N 相对顺序矩阵,再用确定性 "win-accumulation" 解码还原拓扑一致的阅读顺序;自建评测集含 1,000 张图、覆盖 25 类版面元素(文档标题、章节标题、正文、竖排文字、页码、摘要、目录、参考文献、脚注、图题、页眉/页脚、算法、行内/行间公式、公式编号、图、表、印章、图表、旁注等)。PubLayNet mAP 96.2。

  • 360LayoutAnalysis:360 开源版面检测模型,中文文档适配。

  • DocLayout-YOLO:基于 YOLO 的高速区域检测,社区流行,轻量易部署。

  • LayoutLMv3 / LayoutXLM / LiLT:多模态版面理解预训练(详见 3.4.3),多作为下游微调底座而非独立解析器。

  • RT-DETR / Heron:实时检测 Transformer,Docling 采用做区域检测。

3.4 信息提取专项

本节整合「信息提取」的三类子任务——表格提取公式提取信息抽取 KIE:版面分析先定位表格/公式/字段区域,本层再对框内网格结构、公式符号与语义字段做精细化重建。三者即广义“从文档中抽取结构化信息”,是理解能力的最终落点。

3.4.1 表格提取

工具/模型 许可证 有线表 无线表 合并/跨页 输出
Camelot MIT 部分 CSV/Excel/JSON/SQLite
Tabula(-py) MIT CSV/TSV/JSON
pdfplumber MIT 部分 代码→DataFrame
TableTransformer (TATR) MIT(MS) 图像/PDF(需 GPU)
gmft MIT 部分 DataFrame/CSV
StructEqTable-Deploy 表格→LaTeX 高效工具包 LaTeX

经验法则:有线表格用 Camelot(flavor="lattice") 或 Tabula;无线/白隙表用 Camelot(flavor="stream") 或 pdfplumber;图片原生/复杂合并单元格用 TableTransformer 或 VLM 平台(MinerU/Docling)。2025 年工业界标准答案已转向 layout-aware 解析器(MinerU/Docling/Marker)。

深度学习表格结构识别(TSR)模型:规则/几何方法之外,工业级表格结构重建由专用模型支撑——TableFormer(Docling,金融表格强,FinTabNet TEDS>91%)、SLANet / SLANet_plus(PaddleOCR)、PP-TableMagic(PaddleOCR);TATR(微软)在财务/专利/法律/科学文献类表格检测领先。

3.4.2 公式提取

公式提取 = 公式检测(MFD, Mathematical Formula Detection) + 公式识别(MER / im2latex):先由检测模型在页面中定位行内/行间公式框,再由识别模型将裁剪图转为 LaTeX / MathML。难点在于公式是严格二维、可嵌套(上下标、分式、根式、矩阵、多行对齐)的结构,传统 OCR 把公式当一维文本会丢失层级;评价指标除 BLEU、归一化编辑距离(EditDistance)外,CDM(Content Detection Match,UniMERNet 提出) 因不受 LaTeX 等价表达多样性影响,正成为更公平的公式识别度量。

主流公式识别库 / 模型:

库 / 模型 机构 许可证 架构 / 输出 关键性能(版本钉死) 定位
UniMERNet 上海 AI Lab / OpenDataLab Apache-2.0(代码+权重) Donut-Swin 编码 + mBART 解码;LaTeX CDM 全面优于 Texify/GOT 乃至 72B/78B VLM(CVPR 2026);base ExpRate 84.6% / large 87.3% 真实场景复杂/手写公式,MinerU 默认后端
PP-FormulaNet / plus 百度 PaddleOCR Apache-2.0 plus-L(Vary-ViT-B)等;LaTeX En-BLEU 92.22 / Zh-BLEU 90.64(plus-L);S 版约快 10× 中英文公式、追求速度/工程集成
LaTeX-OCR(pix2tex) Lukas Blecher MIT ViT 编码(ResNet 骨干)+ Transformer 解码;LaTeX BLEU 0.88 / normED 0.10(im2latex-100k) 开源基线,仅块级公式
Nougat Meta(FAIR) MIT 代码 + CC-BY-NC 4.0 权重(禁商用) Donut 编码-解码(2×Swin,350M+250M);Mathpix Markdown 英文学术 PDF 公式/表格保真标杆 英文学术文献数字化
Surya LaTeX VikParuchuri / Datalab Apache-2.0 代码 + Modified AI Pubs OpenRAIL-M 权重(<$5M 免费) 650M VLM;LaTeX 公式支持较 Nougat/GOT 有限(见 3.5) Marker 后端,通用 OCR 附带公式
GOT-OCR 2.0 阶跃星辰(StepFun) Apache-2.0(HF 卡;原仓库标"研究用途",口径存异,见 4.3) Vary 编码 + Qwen 解码;统一文本/公式/图表/乐谱 公式→LaTeX,低显存 <3GB 统一端到端 OCR(详见 3.5)
Texify VikParuchuri / Datalab GPL-3.0 代码 + CC-BY-SA 4.0 权重(可商用) Donut 衍生;LaTeX+Markdown 已**弃用**,功能并入 Surya 历史基线,行内+块级公式
Mathpix Snip Mathpix(商业) 闭源 / 付费 API 云端深度学习 OCR 印刷体公式 ~95%+,业界金标准 商业基准锚点(非开源)

识别之前需先定位公式。专用检测模型包括 YOLOv8 微调(PDF-Extract-Kit,AP50≈87.7)Pix2Text-MFD(AP50≈60.1);UniMERNet 也提供基于 PDF-Extract-Kit MFD 的教程。

综合工具包:

  • PDF-Extract-Kit(OpenDataLab):布局检测(DocLayout-YOLO 默认,另支持 YOLO-v10 与 LayoutLMv3 精度优先)+ 公式检测(YOLOv8)+ 公式识别(复用 UniMERNet 权重)+ OCR(PaddleOCR)的模块化工具包,公式识别直接调用 UniMERNet、无需额外微调;各子模型遵循各自许可证(见 4.3)。
  • Pix2Text(breezedeus):国产类 Mathpix 工具,覆盖公式检测+识别(底层复用 LaTeX-OCR),提供易用 API,适合中文公式快速接入。

选型逻辑:追求真实场景复杂/手写公式精度且可商用 → UniMERNet(MinerU 默认);追求中文本地化与高吞吐 → PP-FormulaNet_plus;只需块级公式快速验证 → LaTeX-OCR(pix2tex);英文学术 PDF 数字化且不考虑商用 → Nougat;低显存统一 OCR+公式 → GOT-OCR 2.0;严禁依赖外部 API 的产线应避开 Mathpix

3.4.3 信息抽取(KIE)

版面解析之上,面向“从文档中抽取结构化字段(发票号、金额、日期、实体)”的任务:

模型 机构 架构 特点 代表成绩 / 许可
LayoutLMv3 微软 OCR tokens + 布局 + 图像三模态 英文表单 F1 最高,需 OCR 预处理 FUNSD 92.08 F1;DocVQA ANLS 83.37(开源 SOTA);权重 CC BY-NC-SA 4.0(非商用)
LayoutXLM 微软 LayoutLMv2 多语言版 53 语言预训练 多语言表单理解
LiLT 学术界 布局/文本双 Transformer 解耦 可插拔任意语言模型,跨语言零样本迁移 FUNSD 88.41(配 InfoXLM)
Donut NAVER OCR-free Swin + mBART 免 OCR、像素直出 JSON;训练成本高 CORD 84.1 F1
PP-ChatOCRv4 百度 轻量 OCR + ERNIE 4.5 中文 KIE 开箱即用,精度较上代 +15pct 中文票据/证照场景
TrOCR / GLM-OCR 微软 / 智谱 生成式 OCR TrOCR 文本行识别;GLM-OCR 可 Ollama 部署、schema 引导 JSON MIT/Apache 许可

3.5 通用视觉语言模型(VLM)作为解析引擎

通用 VLM 不是专门的 PDF 解析库,而是 解析后端/底座 ——凭强大文档理解能力被直接调用(如 Zerox、GPTPDF 封装 Qwen/Gemini 作外挂 VLM),或嵌入 MinerU/PP-Structure 的数据构建管线。其优势是零样本泛化强,缺点是成本高、存在幻觉文本风险。

3.5.1 专用文档 VLM(端到端)

模型 规模 许可 关键特征 代表成绩
PaddleOCR-VL-1.6 0.9B Apache-2.0 NaViT 动态分辨率 + ERNIE-4.5-0.3B,代码与权重均无商用限制,109 语种,支持异形框/印章/跨页 OmniDocBench v1.6 96.33(小模型 SOTA,2026 Q3 被 OvisOCR2 96.58 / TeleOCR 96.87 超越)
HunyuanOCR 1B Tencent Hunyuan Community License(排除 EU/UK/韩国) 中文文档优化 OmniDocBench v1.6 94.74(HunyuanOCR-1.5)
MinerU2.5 1.2B 权重需点协议 复杂版面鲁棒 OmniDocBench v1.6 93.04(base)/ 95.75(Pro)
Dots.OCR → dots.mocr 1.7B→3B MIT 图表→SVG 代码,多语 olmOCR-Bench 83.9
GOT-OCR 2.0 580M 研究用途(原仓库)/ Apache-2.0(HF 卡,存争议) 乐谱/分子式/几何图形多模态 边缘/低显存首选
DeepSeek-OCR 2 / OCR2 3.39B(MoE) MIT ~100 语言,批量成本优 大规模批处理
olmOCR 7B Apache-2.0 GPT-4o 作为教师生成训练数据、Qwen2-VL-7B 作为学生基座微调,小 VLM 做 OCR 英文学术文献
Nougat CC-BY-NC 2023 LaTeX 还原先驱 历史基线(禁商用)

3.5.2 通用 VLM 后端(非专为 OCR 设计)

模型 规模 许可 关键特征
Qwen2.5-VL 3B→72B 权重 Apache-2.0(72B 超大规模需遵循 Qwen 社区许可) DocVQA 95.7、QwenVL HTML 版面格式,中文文档首选后端之一
InternVL2.5 多档 通用多模态,英文/通用
GLM-4V-9B 9B 代码 Apache-2.0 / 权重 OpenRAIL-M 1120×1120 端到端中文 OCR,允许商用(年营收<200 万美元初创免费,禁生成违法/歧视内容)
MiniCPM-V 2.6 8B(SigLip-400M + Qwen2-7B) Apache-2.0 OCRBench SOTA,端侧友好

4. 综合对比分析

4.1 第一梯队端到端系统对比(Docling / MinerU / Marker / PaddleOCR)

维度 Docling MinerU Marker 2 PaddleOCR/PP-StructureV3
范式 Pipeline + 可选 VLM Pipeline + MinerU2.5 VLM Surya 套件编排 + 可选 LLM 精修 Pipeline + PaddleOCR-VL
版面模型 RT-DETR / Heron DocLayout-YOLO(PDF-Extract-Kit 为同团队工具包,可选 LayoutLMv3) Surya 20M 快速版面 PP-DocLayout 系列
表格 TableFormer(金融强,FinTabNet TEDS>91%) 强(跨页合并) 基础(TEDS 约 75–80%,LLM 补强) PP-TableMagic
公式 一般(复杂嵌套弱) 最强(UniMERNet,LaTeX,编号) Surya LaTeX PP-FormulaNet_plus
OCR 可插拔 Tesseract/EasyOCR/RapidOCR 内置 PaddleOCR Surya OCR 2(~650M) PP-OCRv6(单模型 50 语)
输入格式 最广(PDF/DOCX/PPTX/XLSX/HTML/EPUB/邮件/音频) PDF/图/DOCX PDF/图/PPTX/DOCX/XLSX/HTML/EPUB PDF/图
多语言 取决于 OCR 后端 109 语言,CJK 最强 90+(Surya) 50 语统一 / VL 版 109 语
硬件 纯 CPU 可跑 高精度路径需 GPU(≥8GB) CPU 可跑,批量需大 GPU(~3–5GB/worker) CPU/GPU 均可,边缘 1.5M 起
许可证 MIT(Granite Apache-2.0) MinerU Open Source License(Apache-2.0 系,≥3.1.0 由 AGPLv3 切换) 代码 Apache-2.0 + 权重 OpenRAIL-M($5M 门槛) Apache-2.0(代码+权重无限制)
治理 LF AI & Data,IBM/Red Hat 背书 社区活跃,Star 最高 Datalab 公司主导 百度开源,持续迭代

4.2 精度基准

本报告参考如下两个主流评测基准。注意各仓库自报分数存在“选择性打榜”现象(如 marker README 强调其领先 MinerU/docling,dots.ocr README 强调其超越 MinerU2.5),横向对比时应优先采用同一来源、同一版本的榜单数据,并以自有业务样本复测为最终依据。

基准 维护方 规模与构成 评测方式 备注
OmniDocBench OpenDataLab(上海 AI 实验室) v1.0 含 981 页真实 PDF,覆盖 9 大文档类型、4 种布局类别、3 种语言,超 2 万个区域级标注;v1.5 进一步扩充 端到端整页解析 + 模块级(OCR/表格/公式/阅读顺序)双维度;采用 CDM(Content-Driven Matching)内容驱动匹配框架,降低空白/样式噪声影响 中英文档解析领域引用最广的基准之一,PP-StructureV3、MinerU2.5、PaddleOCR-VL、dots.ocr 等均在此打榜
olmOCR-Bench Allen Institute for AI(AI2) 1,400+ 份 PDF、7,000+ 项单元测试,覆盖数学公式、表格、多栏、古旧扫描件、页眉页脚、超长小字等 8 类硬场景 单元测试式断言(文本存在性、属性、计数等),输出总分 由 olmOCR 团队发布,被 marker、dots.ocr、surya 等多家第三方主动引用对比

4.2.1 OmniDocBench v1.6

OmniDocBench(CVPR 2025,上海人工智能实验室 / OpenDataLab,arXiv:2412.07626)是当前文档解析选型的核心综合基准。其端到端 Overall(官方排行榜称 Accuracy,满分 100,越高越好)由三项子指标按固定权重合成:

Overall = ((1 − TextEditDist) × 100 + TableTEDS + FormulaCDM) / 3
  • TextEditDist:纯文本归一化编辑距离(越低越好);
  • TableTEDS:表格结构 TEDS 相似度;
  • FormulaCDM:公式字符检测匹配 CDM。

本报告固定 OmniDocBench v1.6 为统一口径(截至 2026-09 公开最完整的官方排行榜版本;v1.6 引入 MGAM 多粒度自适应匹配与 296 页 Hard 子集)。

模型(版本) 参数量 Overall↑ (v1.6) 备注
TeleOCR 1.2B 96.87 阿里,2026 Q3 开源新 SOTA(arXiv:2608.12898)
OvisOCR2 0.8B 96.58 阿里 ATH-MaaS,小模型 SOTA
PaddleOCR-VL-1.6 0.9B 96.33 0.9B 小模型前列(已被上二者超越)
MinerU2.5-Pro 1.2B 95.75 数据为中心扩展版
GLM-OCR 0.9B 95.22 智谱
PaddleOCR-VL-1.5 0.9B 94.93 上一版(v1.5/v1.6 归属存疑,见注)
HunyuanOCR-1.5 1B 94.74 升级版
PaddleOCR-VL 0.9B 94.18 初版
Qianfan-OCR 4B 93.90
Youtu-Parsing 2.5B 93.74
Ovis2.6-30B-A3B 30B 93.70 通用 VLM
Logics-Parsing-v2 4B 93.33
FireRed-OCR 2B 93.26
MinerU2.5 1.2B 93.04 基础版(本报告主引用)
dots.ocr 3B 90.77
OpenDoc-0.1B 0.1B 90.67
DeepSeek-OCR 2 3.39B(MoE) 90.25
HunyuanOCR 1B 89.95 基础版(v1.5 口径曾报 94.1)
olmOCR 7B 85.74 GPT-4o 教师蒸馏
Mistral OCR (API) 85.66 商业 API 参照

数据出处:OmniDocBench 官方排行榜 github.com/opendatalab/OmniDocBench(Papers With Code / CodeSOTA 镜像),经 arXiv:2606.03264 与 arXiv:2608.12898v3 两篇 2026 论文交叉校验(TeleOCR 96.87、OvisOCR2 96.58 等 2026 Q3 新模型已纳入表中)。所有数字为厂商/论文自报,建议以自有样本 POC 复测为最终裁决。

4.2.2 olmOCR-Bench

Allen AI 第三方基准,1,403 份 PDF、8 类子集 macro-average(越高越好)。数字取自 olmOCR 仓库与 dots.ocr 仓库,两源完全一致。

模型(版本) Overall 说明
Mistral OCR (API) 72.0 商业 API 参照
MinerU 2.5.4* 75.2 端到端
DeepSeek-OCR (3B) 75.7
Marker 1.10.1 76.1 balanced 路径
dots.ocr (1.7B) 79.1
PaddleOCR-VL* (0.9B) 80.0 小模型高调位
olmOCR v0.4.0 (7B) 82.4 GPT-4o 教师蒸馏
Surya OCR 2 83.3 Surya 模型栈新版
dots.mocr (3B) 83.9 公实数值准确
Chandra 2(Datalab) 85.8–85.9 Datalab 旗舰模型(2026)
Nanonets OCR-3 87.4 商业/开源混合
Infinity-Parser2-Pro 87.6

星标(*)为各仓库官方复测版本。结论:dots.mocr 83.9 公实数值准确,但 2026 年已被 Chandra 2(85.8–85.9)、Infinity-Parser2-Pro(87.6)、Nanonets OCR-3(87.4) 等超越,“开源 SOTA 区间”说法已不成立;Surya OCR 2 自身为 83.3。端到端小模型已逼近甚至超过部分商业 API。

4.3 许可证与商用矩阵

PDF 文档解析系统的许可证分「代码许可」与「权重许可」两层——代码开源 ≠ 权重可商用,商用前须逐一核对仓库 LICENSE 与模型卡。

项目 代码许可 权重许可 商用注意点
MinerU Apache-2.0 系 MinerU Open Source License(附加商业条款) ≥3.1.0 由 AGPLv3 切换;超 100M MAU 或 $20M/月营收需商业授权,在线服务须标明
Marker / Surya Apache-2.0 修改版 AI Pubs OpenRAIL-M 融资/营收 ≥$5M 企业商用需付费授权
Docling MIT MIT(GraniteDocling 等以模型卡为准) 无显著门槛
PaddleOCR(含 PP-StructureV3) Apache-2.0 Apache-2.0 无显著门槛
PaddleOCR-VL Apache-2.0 Apache-2.0 无显著门槛
olmOCR Apache-2.0 Apache-2.0 无显著门槛
Unstructured Apache-2.0 开源库与付费云 API 功能有差异
dots.ocr / dots.mocr MIT MIT 无显著门槛
DeepSeek-OCR 2 MIT MIT 无显著门槛
GOT-OCR 2.0 Apache-2.0 Apache-2.0 注:原仓库标"研究用途",HF 卡为 Apache-2.0,口径存异,商用前核对
HunyuanOCR Tencent Hunyuan Community License 同左(排除 EU/UK/韩国) 商用须评估地域排除条款
DocLayout-YOLO AGPL-3.0 以仓库为准 SaaS/闭源集成有传染风险
PDF-Extract-Kit AGPL-3.0 组件各异 同上,且组件许可需逐个核对
LayoutLMv3 MIT(代码) CC-BY-NC-SA 4.0(非商业) 权重不可商用
MarkItDown MIT PDF 底座 PyMuPDF 为 AGPL,深度集成需评估
PyMuPDF AGPL-3.0 / 商业双授权 闭源产品需购买商业许可
pdfplumber / pdfminer.six / Tesseract / EasyOCR / RapidOCR MIT / MIT / Apache-2.0 / Apache-2.0 / Apache-2.0 同左 无显著门槛

4.4 选型决策树

  1. 文档是否含扫描/图片且无文本层?是 → 先 OCR(PaddleOCR 中文 / Tesseract 离线 / HunyuanOCR);否 → 进入 2。
  2. 中文技术文档 / 公式密集 / 表格多?→ MinerU
  3. 多格式(PDF+Office+HTML)企业 RAG / 强合规离线?→ Docling(MIT,纯 CPU,气隙部署)。
  4. 快速转 Markdown、代码 Apache-2.0 友好?→ Marker(注意权重 AI Pubs OpenRAIL-M 的 $5M 商用门槛)。
  5. 仅提取规则表格?→ Camelot / pdfplumber
  6. 纯文本快速抽取?→ PyMuPDF4LLM / pdfplumber
  7. 轻量端到端 / 消费级 GPU?→ HunyuanOCR / Dots.OCR / GOT-OCR 2.0
  8. 已具备 GPU 与工程能力、想要自研解析后端?→ Qwen2.5-VL / InternVL2.5 / GLM-4V-9B / MiniCPM-V 2.6,同一模型兼顾解析与 RAG 问答,且可避开 AGPL 约束。
  9. 发票/表单字段抽取(中文)?→ PP-ChatOCRv4 / Donut。

5. 总结

PDF 解析已从“文本抽取”进化为“文档智能”。开源生态在 2024–2026 年完成关键跃迁:以 MinerU、Docling、Marker 为代表的综合平台,结合 PaddleOCR、HunyuanOCR、Dots.OCR、GOT-OCR 2.0 等识别引擎,以及 Camelot、pdfplumber、LayoutParser、PP-Structure 等专项工具,已能覆盖 OCR、版面分析、信息提取与格式转换的全链路需求,并在多个基准上逼近甚至超过商业 API。

2026 年形成清晰的“三超 + 一厂”格局:MinerU 在表格/公式/CJK 维度综合最强(但 OmniDocBench Overall 已被 PaddleOCR-VL-1.6/TeleOCR/OvisOCR2 超越)Marker 轻量转 Markdown 场景采用广(但权重许可证构成商用门槛,且 GitHub Star 约 39.8k 低于 MinerU 80.2k 与 Docling 66.6k)Docling 覆盖面与合规性最强(MIT + 纯 CPU + 企业治理)PaddleOCR 以 Apache-2.0 全栈 + 中文主场 + 0.9B 小模型高调位成为许可证敏感型企业的最优解(GitHub 79k+ 已超越 Tesseract)。经典工具(PyMuPDF/pdfplumber/Camelot)在规则化数字原生文档上仍是成本最低方案。

关键技术趋势如下:

  • VLM 端到端成为主流:Nougat→GOT-OCR 2.0→HunyuanOCR→Dots.OCR→MinerU 2.5 表明,单次前向推理统一检测/识别/版面/表格/公式/翻译,正系统性替代级联流水线。

  • VLM 小型化竞赛:1.2B 的 MinerU2.5、0.9B 的 PaddleOCR-VL、258M 的 Granite-Docling 相继刷榜,证明分辨率工程 > 参数堆叠成为新范式,端侧/CPU 部署边界不断下移。

  • 双后端成为标配:管线(低成本兜底)+ VLM(高精度攻坚)二元架构 + 级联策略,是 2026 年生产系统主流拓扑。

  • 多模态融合与结构化输出:公式→LaTeX、表格→HTML、流程图→Mermaid、图表→SVG(dots.mocr),输出从纯文本走向机器可读结构化对象。

  • Agent / MCP 原生集成:MinerU、Docling、Unstructured 均已支持 MCP 与主流 Agent 框架;Docling 已有 OpenShift Operator,解析从”库”推向“服务”。


附录 A 项目索引

名称 GitHub / 主页
MinerU github.com/opendatalab/MinerU
Docling github.com/docling-project/docling
Marker github.com/datalab-to/marker
olmOCR github.com/allenai/olmocr
Unstructured github.com/Unstructured-IO/unstructured
DeepDoctection github.com/deepdoctection/deepdoctection
DocXChain github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/Applications/DocXChain
Tesseract github.com/tesseract-ocr/tesseract
PaddleOCR github.com/PaddlePaddle/PaddleOCR
EasyOCR github.com/JaidedAI/EasyOCR
Surya github.com/VikParuchuri/surya
GOT-OCR 2.0 github.com/Ucas-HaoranWei/GOT-OCR2.0
HunyuanOCR github.com/Tencent/llm.hunyuan.ocr
Dots.OCR github.com/rednote-hilab/dots.ocr
LayoutParser github.com/Layout-Parser/layout-parser
PP-Structure github.com/PaddlePaddle/PaddleOCR
360LayoutAnalysis github.com/360AIResearch/360LayoutAnalysis
Camelot github.com/camelot-dev/camelot
Tabula github.com/tabulapdf/tabula
pdfplumber github.com/jsvine/pdfplumber
TableTransformer github.com/microsoft/table-transformer
PDFMiner.six github.com/pdfminer/pdfminer.six
PyMuPDF / 4LLM github.com/pymupdf/PyMuPDF
markitdown github.com/microsoft/markitdown
Nougat github.com/facebookresearch/nougat
pdf-craft github.com/oomol-lab/pdf-craft
pandoc pandoc.org
SmolDocling github.com/docling-project/smoldocling
Parxy 统一多解析器 API 网关
StructEqTable-Deploy github.com/UniModal4Reasoning/StructEqTable-Deploy
chunkr github.com/lumina-ai-inc/chunkr

附录 B 参考资料

  1. Livathinos et al., Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion, arXiv:2501.17887(IBM 官方技术报告与基准)
  2. Cui et al., PaddleOCR 3.0 Technical Report, arXiv:2507.05595(PP-StructureV3 五模块架构)
  3. A Comparative Study of PDF Parsing Tools Across Diverse Document Categories, arXiv:2410.09871(DocLayNet 十工具对比)
  4. PaddleX / PaddleOCR 官方文档:PP-StructureV3、PP-DocLayoutV2 阅读顺序机制
  5. Camelot 官方对比文档(2026-05 版,与 Tabula/pdfplumber/PyMuPDF/unstructured 逐项对比);camelot-dev/camelot v2.0.0 发布说明(2026)
  6. olmOCR-Bench(Ai2)、OmniDocBench(CVPR 2025,arXiv:2412.07626)公开榜单及 2026 年第三方复测报道
  7. pdfmarkdownapp/pdf-to-markdown-benchmark(MIT,公开答案键与缺陷账本)
  8. "Docling vs Marker vs MinerU: The Ultimate Open-Source PDF Parser Benchmark (2026)", Aditya Mangal(含可复现评测脚本与许可分析)
  9. Datalab, Marker 2 发布与 olmOCR-bench 对比(2026-07);Best Open-Source OCR Models 2026 (Compared)(2026-08 更新);Chandra 2 旗舰 OCR 模型(olmOCR-Bench 85.8–85.9)
  10. HunyuanOCR 技术报告, arXiv:2607.04884(331 语种;OmniDocBench v1.6 94.74)
  11. TeleOCR, arXiv:2608.12898(OmniDocBench v1.6 96.87,2026 Q3 开源 SOTA)
  12. OvisOCR2(阿里 ATH-MaaS,OmniDocBench v1.6 96.58);MinerU 3.4/4.0 发布说明(2026-06 / 2026 后续,GitHub opendatalab/MinerU)

本报告由 Kimi2.7、Qwen3.8-max、Hunyuan3、DeepSeek-v4.1-flash、Claude Opus 5 基于公开技术资料、官方仓库、技术博客与 2025–2026 年公开基准整理,数据截至 2026-09。具体版本能力与许可证以各项目官方仓库最新声明为准。