ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

MinerU 实战指南:把 PDF 与 Office 文档一次性转为 Markdown 和 JSON

MinerU 实战指南:把 PDF 与 Office 文档一次性转为 Markdown 和 JSON MinerU 实战指南把 PDF 与 Office 文档一次性转为 Markdown 和 JSON【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 是一个开源文档解析工具把 PDF、DOCX、PPTX、XLSX 和图片文件转换成 Markdown、JSON 这类机器可读的格式供检索、抽取和大模型工作流使用。如果你的需求是 PDF 转 Markdown、给 RAG 知识库建语料或者要把大量合同、报告文件批量结构化它就是为这类场景设计的。纯 CPU 机器和 GPU 机器都能跑兼容 Windows、Linux 和 macOS。它解决什么问题常见文本提取工具的产出往往不好直接用多栏版面的阅读顺序会乱表格和公式丢失或变成乱码扫描版 PDF 根本没有文本层。MinerU 按阅读顺序输出文本自动去掉页眉、页脚、页码把表格转成 HTML、公式转成 LaTeX并能自动识别扫描版和乱码 PDF 后启用 OCR省掉了大部分后续人工整理。安装 MinerU 并跑通第一次转换安装走一条 pip 命令mineru[all]包含全部核心功能uv pip install -U mineru[all] # 或者pip install -U mineru[all]需要改源码的话从 https://gitcode.com/GitHub_Trending/mi/MinerU 克隆仓库然后执行uv pip install -e .[all]即可。装好后第一次运行只需要一条命令。输入可以是单个文件也可以是一个目录支持 PDF、图片和 DOCX / PPTX / XLSXmineru -p demo/pdfs/demo1.pdf -o output首次使用有两个注意点首次运行会自动下载所需模型文件之后直接复用本地缓存。如果网络访问不了 huggingface先执行export MINERU_MODEL_SOURCEmodelscope切换到国内镜像源。机器没有 GPU 时加上-b pipeline参数pipeline 后端支持纯 CPU 环境推理。上图是 MinerU 解析流程的全景一份文件经过预处理、版面与公式检测、坐标修复和段落合并等管线处理最后以 Markdown、JSON 和中间态middle_json等统一格式输出。如果你更喜欢图形界面用内置的 Gradio WebUI 即可mineru-gradio启动后在浏览器访问 http://127.0.0.1:7860上传文件并勾选解析选项就能出结果。核心能力拆解多格式文档如何解析能做什么原生解析 PDF、图片、DOCX、PPTX、XLSX不需要先把 Word 转成 PDF 再处理DOCX 走原生解析链路端到端速度明显快于先转 PDF的传统做法。怎么用mineru -p 输入文件 -o 输出目录即可输入给目录时可以一次解析目录下所有受支持的文件。表格与公式如何转换能做什么识别文档中的表格并转成 HTML识别公式并转成 LaTeX支持表格内图片/公式、跨页表格合并等复杂场景。怎么用表格和公式识别默认开启直接出结果如果只处理纯文本、想加快解析速度可以通过命令行参数关闭这两项参数说明见命令行工具文档。OCR 与多语言内容如何处理能做什么自动检测扫描版 PDF 和乱码 PDF 并启用 OCROCR 支持 109 种语言的检测与识别中英文混合文档开箱可用。怎么用解析方式默认是auto由 MinerU 自行判断走文本提取还是 OCR使用 pipeline 后端时还可以传语言提示参数辅助识别。输出格式与可视化校验能做什么除 Markdown 外还输出按阅读顺序排序的 JSON 和包含丰富信息的中间格式图片、图注、表格、脚注都会被提取保留。内置 layout 可视化和 span 可视化把识别出的区块画回原页面上便于质检输出质量。怎么用解析完成后在输出目录打开对应结果文件即可做质量核对时先看 layout 可视化图确认区块划分和阅读顺序是否符合预期。上图是 layout 可视化示例页面上的正文段落、章节标题、公式块都被框出标注一眼能看出版面切分是否正确。适合谁、与相邻工具的差异文档处理工具大致分三类可以对照自己的需求选择工具类型特点局限纯文本提取工具快直接抽文本层多栏版面易乱序表格公式丢失扫描件无能为力OCR 服务解决扫描件无文本层问题产出多为无结构文本版面重建要自己再做MinerU先识别版面再按阅读顺序输出表格公式直接转换对 GPU 机型有更高配置要求可选对开发者来说两个最实用的入口是 CLI 和mineru-apiFastAPI 服务后者提供异步任务接口方便搭批量解析流水线也提供 MCP Server 和 Dify、RAGFlow、FastGPT 等框架的原生集成接入 AI 编程工具或知识库平台都比较直接。硬件上按需选择pipeline 后端兼容性好纯 CPU 就能跑hybrid / vlm 后端精度更高适合显存 8GB 以上的 GPU 机型。资源导航官方文档中文docs/zh/快速上手与使用指南docs/zh/usage/quick_usage.md核心解析源码mineru/backend/示例文件与演示脚本demo/【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表