当前位置:首页 > 报告详情

MinerU:面向 Agent 时代的文档解析基础设施演进与实践 何聪辉 .pdf

上传人: 散** 编号:1277131 2026-07-11 41页 11.68MB

1、MinerUMinerU-面向面向AgentAgent时代的文档解析基础设施演进与实践时代的文档解析基础设施演进与实践演讲人:何聪辉上海人工智能实验室/青年科学家目录目录01020504背景MinerU 整体演进MinerU 生态建设未来展望与探索03背景背景从从 OCR OCR 到智能文档理解的演进历程到智能文档理解的演进历程文档解析的四文档解析的四个发展阶段个发展阶段20152015传统传统 OCR OCR 时代时代单一任务纯文本提取聚焦街景文字识别和扫描文档代表:CRNN,EAST,PaddleOCR复杂排版解析能力有限20242024大模型团队觉醒大模型团队觉醒知识载体RAG 检索LL

2、M 预训练高质量数据供给解析精度决定 RAG 答案可靠性金融/法律/医疗场景需求爆发20252025百家争鸣百家争鸣标配维度评测基准文档解析成为大模型基础能力标配代表:Gemini 3 Pro,GPT-5,DeepSeekOmniDocBench 成为共识基准20262026应用爆发应用爆发智能体办公生产力场景AI 办公与智能体时代全面兴起代表:Claude Code,OpenClaw覆盖合同审查、研报分析等场景大模型时代文档解析的核心地位大模型时代文档解析的核心地位场景一:场景一:LLM LLM 预训练数据管线预训练数据管线90%+90%+学术论文 PDF 占比TB TB 级级未挖掘高质量文

3、档数据互联网数据瓶颈:互联网数据瓶颈:网页数据已不足以支撑模型持续进化,高质量语料日益稀缺。解析质量决定数据质量:解析质量决定数据质量:文档解析的准确性直接影响预训练数据的质量,进而影响 LLM 能力上限。场景二:场景二:RAG RAG 系统精准检索系统精准检索解析精度解析精度=答案可靠性答案可靠性误差传播效应:误差传播效应:解析阶段的微小误差会在后续环节(分块、向量化)被放大,最终影响生成质量。领域特化需求:领域特化需求:不同领域解析精度要求不同,金融研报要求数据极高准确性,法律合同要求条理清晰,医疗病历关乎生命安全。MinerU MinerU 整体演进整体演进三个阶段的技术飞跃三个阶段的技

4、术飞跃:Pipeline Pipeline 解耦式解耦式VLM VLM 数据驱动新范式数据驱动新范式智能数据提取引擎智能数据提取引擎-MinerU-MinerU官方网站官方网站 开源社区开源社区 构建RAG更多MinerU v1MinerU v1:PipelinePipeline方法方法-2024-2024年初年初背景与动机背景与动机端到端大模型端到端大模型如 Nougat,仅支持英文、速度慢、幻觉严重传统拼凑方案传统拼凑方案如 Marker,简单拼凑已有方法,效果很差Library Library 解析解析如 PyMuPDF,无法处理扫描件OCR OCR 直接提取直接提取丢失文档结构,表格/

5、公式噪声大公式识别与评测公式识别与评测CVPR 2026CVPR 2026CVPR 2025CVPR 2025UniMERNet UniMERNet 公式识别:公式识别:提出百万级多样性公式数据集,性能对标 Mathpix 商用软件。CDM CDM 公式评测指标:公式评测指标:针对 LaTeX 表达多样性,提出图像渲染级对比,解决 Edit Distance 不合理问题。布局检测布局检测SOTASOTADocLayout-YOLODocLayout-YOLO:结合 YOLO 速度优势与 Mesh-candidate BestFit 数据合成技术。极致性能:极致性能:基于 DocSynth-30

6、0K 训练,检测速度比 LayoutLMv3 快一个数量级。发布两个月内多次登顶发布两个月内多次登顶 GitHub Trending Python GitHub Trending Python 榜首榜首MinerU PipelineMinerU Pipeline总览总览预处理阶段内容解析阶段后处理阶段格式转换阶段学术论文TextTitleImageTableEquation考试试卷报纸期刊教材财务报告MinerU v2.5MinerU v2.5:解耦式多模态大模型:解耦式多模态大模型-2025-2025年年9 9月月OmniDocBench OmniDocBench 评测基准评测基准在优化模型

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **MinerU演进**:从Pipeline(2024)→解耦式VLM(2025,OmniDocBench首个突破90分)→数据驱动新范式(2026,1.2B参数达95.69分,纯数据工程提升+2.71分)。 2. **核心创新**: - ADR原子解耦公式识别、OTSL表格优化(28→5 token)、IMIC推理一致性挖掘。 - 三阶段数据工程:65.5M预训练数据+3.9M难样本+GRPO优化。 3. **生态影响**:GitHub 6万星标,900万模型下载,10亿+文档解析页,支撑金融/医疗/化学等领域应用。 4. **未来方向**:AgenticOCR动态解析、MinerU-Diffusion扩散式解码(3.26×加速)。
**MinerU如何演进?** **文档解析瓶颈在哪?** **未来如何突破?**
客服
商务合作
小程序
服务号
折叠