目录
一、MinerU介绍
1)主要功能
2)核心技术
3)应用场景
二、MinerU如何使用
1)在线使用
2)在线 API
3)私有化部署Magic‑PDF(适合涉密数据)
MinerU 是专注于高效解析和提取复杂的PDF 文档、网页和电子书,并将其转换为易于分析的Markdown 或 JSON 格式 的工具,是大模型知识库、学术文档处理的前置预处理利器。由上海人工智能实验室OpenDataLab团队开发。地址如下:
MinerU | 面向 Agent 和 RAG 的智能文档解析平台https://mineru.net/
一、MinerU介绍
1)主要功能
• PDF 转Markdown :支持多模态PDF(含图片、表格、公式等)的结构化转换。 自动去除页眉、页脚、脚注等干扰信息,保留标题、段落、列表等结构。 公式识别并转换为LaTeX 格式,表格转换为Html 或Markdown。
• 网页内容提取:从网页中剔除广告等干扰信息,精准提取正文、评论、视频文字等内容。
• 电子书转换:支持epub、mobi、docx、pptx、chm、azw等格式批量转Markdown。
• 多语言OCR:自动检测扫描版PDF 和乱码,支持84 种语言的OCR 识别
2)核心技术
MinerU 不是单一大模型,是多模型 Pipeline 协同工作。
• 布局检测:基于LayoutLMv3微调,识别文本、表格、图片等区域。
• 公式识别:使用YOLOv8检测公式,UniMERNet模型转换LaTeX。
• OCR 增强:采用PaddleOCR提高文本识别准确率。
3)应用场景
• 大模型训练:为书生·浦语等模型提供高质量语料。
• 学术研究:提取论文、教材中的关键信息。
• 法律与金融:解析合同、研报等结构化数据。
运行环境兼容 Windows / Linux / Mac,CPU、GPU 均可运行;CPU 可以跑但是解析速度慢,GPU 环境会大幅提升处理效率。
二、MinerU如何使用
1)在线使用
上传文件后稍等,文档解析完成后点击右上角的下载按钮可以将转换完成的内容下载下来
输出两种核心格式的区别:
- Markdown:精简文本,适合直接输入大模型做问答、RAG 检索;
- JSON:携带页面坐标、布局等完整元信息,信息量大,适合二次开发、深度数据分析。
这是下载的md格式的内容:
图片被提取出来占位了,MinerU 本身不理解图片内容,图片后续需要交给 Qwen‑VL 这类多模态模型二次解析。
表格被转换成HTML格式了,这是由于HTML对合并单元格、复杂表格兼容性优于原生 Markdown 表格。
2)在线 API
1.申请Token
这个Token申请免费,但是有一些限制:
文档里面还给了一些代码的示例和参数的讲解。MinerU 文档解析接口文档 可以把代码拿出来跑一跑。如下:返回字段中的zip包,就是文件解析结果:
⚠️注意:涉密、企业内部敏感文档不建议使用云端 API,数据会上传到平台。
3)私有化部署Magic‑PDF(适合涉密数据)
Step1,安装magic-pdfpip install -U "magic-pdf[full]"
Step2,下载依赖的modelspython download_models.py使用modelscope快速下载各种models
Step3,推理pdfmagic-pdf -p 三国演义.pdf -o ./output
大家可以动手来部署推理一下。