
MarkItDown 快速上手一条命令把 PDF、Word、Excel 转成 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownMarkItDown 是微软开源的 Python 工具把 PDF、Word、Excel、PPT、图片、音频、HTML 等文件统一转换成 Markdown。它解决的核心问题是各种格式的文档没法直接喂给大模型或文本分析管道而它能在转换时保留标题、列表、表格、链接这些关键结构。先从一个真实场景说起 假设你手头有一批材料要整理进知识库十几份产品手册 PDF、几个 Word 方案文档、两份 Excel 报价表还有一段 40 分钟的访谈录音。传统做法是一份份打开、复制、粘贴、再手动调格式最后得到的还是散落的纯文本。问题在于大模型其实最认的格式是 Markdown。标题、表格、列表这些结构信息在 Markdown 里都有对应写法而且 Markdown 非常省 token同样的内容比原始富文本更省上下文。真正麻烦的是转换这一步PDF 里的表格经常被拉平成乱码Word 里的层级标题消失录音里的内容更是根本变不成文字。MarkItDown 的思路就是只做这一件事——把文件变成带结构的 Markdown并且尽量保真。转换过程在本地完成不上传文件一条命令就能跑通。安装 MarkItDown 并跑通第一条转换命令 前提只需 Python 3.10装好之后最短路径如下python -m venv .venv source .venv/bin/activate pip install markitdown[all] markitdown report.pdf -o report.md[all]会装齐所有格式的可选依赖。如果只需要其中几种也可以更省pip install markitdown[pdf,docx,pptx]按 PDF、Word、PPT 这样按需勾选。转换命令本身很直接把文件名丢给markitdown结果默认打印到终端加-o 文件名.md就是写入文件。它同样支持管道输入cat report.pdf | markitdown可以边传边转适合处理不方便落盘的大文件。核心能力值得单独讲清楚的三件事 扫描件和 PDF 里图片的文字OCR 提字普通的 PDF 转换器只读数字层里的文本扫描件在数字层里是空白的输出自然少得可怜。MarkItDown 官方提供了markitdown-ocr插件用视觉大模型读取 PDF、Word、PPT、Excel 里嵌入的图片把文字补回到对应位置还保留原文档的段落顺序。上图是一份学术论文 PDF 在测试集里的样子像这种带公式、图和双栏排版的文档转换后标题层级和正文顺序基本能对上。插件用法是一个几行的小例子from markitdown import MarkItDown from openai import OpenAI md MarkItDown( enable_pluginsTrue, llm_clientOpenAI(), llm_modelgpt-4o, ) print(md.convert(scanned_invoice.pdf).text_content)任何兼容 OpenAI API 的客户端都能接进来详见 markitdown-ocr 插件说明。音频转文字录音直接变成会议纪要装完[all]之后或单独pip install markitdown[audio-transcription]wav 和 mp3 文件可以直接转markitdown interview.wav -o 会议纪要.md适合会后快速留档。它的定位是基础转录如果你还需要识别视频文件那是后面云端方案才覆盖到的。结构保留表格、层级和分页标记都还在MarkItDown 输出的不是一坨文本。Excel 会转成 Markdown 表格PPT 的每一页会插一个!-- Slide number: 1 --之类的注释做分页锚点图片默认以占位符形式保留不想留 base64 内嵌图的话这是好事需要时用--keep-data-uris开关。常见输入输出的对应关系大致如下输入你会得到PDF / 扫描件按页组织的正文标题保留层级扫描件需配 OCR 插件Word、PPT标题变 Markdown 标题页/幻灯片有注释标记演讲者备注也会带上Excel、CSV标准 Markdown 表格列名即表头图片EXIF 元数据配 LLM 客户端时输出图片内容描述音频语音转录文本加元数据HTML、JSON、XML、ZIP正文转 Markdown 或按条目展开这张测试集里的图形图展示的就是图片转文字描述的场景给它配llm_client和llm_model后图片会输出一段可读的内容说明而不是一个二进制。进阶玩法插件和云端两条路 插件体系默认关闭用markitdown --list-plugins查看装了哪些转换时加-p即可启用。前面讲的 OCR 插件就是典型想自己写一个示例插件源码 是个很好的模板注册一个转换器就行。云端方向有两条Azure Document Intelligence 适合扫描件和复杂表格命令上加-d -e endpointAzure Content Understanding 更进一步能抽取结构化字段发票金额、合同条款这类并以 YAML 前置块输出还能处理视频文件命令是markitdown 文件.pdf --use-cu --cu-endpoint endpoint。两者都是按调用计费的 Azure 服务本地转换则完全免费。常见坑解答 Q转换出来的 Markdown 排版没那么好看能给人直接看吗A它的输出主要是给文本分析工具和 LLM 消费的结构在、措辞在但页面级的精细排版不保证。如果你要的是可印刷的还原版式它不是对的选择如果目标是进知识库、喂模型它反而比很多人类友好的转换结果更稳。Q中文文档和中文扫描件能用吗A可以。文本类格式Word、Excel、PDF 数字层中文没有特殊问题扫描件走 OCR 插件时识别质量取决于你接的视觉模型对中文的支持程度建议挑中文表现好的模型。Q大文件会不会爆内存A优先用管道方式cat 大文件.pdf | markitdown或者 Python API 里的convert_stream()都是流式读取。另外输出里的 base64 内嵌图默认会被截断能避免输出文件突然膨胀需要完整图片时再显式加--keep-data-uris。Q在服务端处理用户上传的文件要注意什么AMarkItDown 以当前进程权限做 I/O会把能访问的路径和 URI 都当真。处理不可信输入时建议只调用最窄的转换方法比如convert_local()只碰本地文件并先校验输入来源。适合谁以及下一步 ✅如果你经常要把散落的办公文档、扫描件、录音整理给大模型用或者要给一堆文件建一个统一的文本索引MarkItDown 基本可以装完就用本地转换免费、结构保留得不错、想增强随时有插件和云端两条路。去pip install markitdown[all]拿一份你手边最乱的文件跑一下第一条命令看看输出再决定要不要接上 OCR。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考