
Umi-OCR 完整指南从截图识别到批量转文字的免费离线 OCR 上手手册【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR从屏幕截图里提取文字、把一堆 PDF 扫描件变成可搜索文本这些事不一定要把图片上传到在线服务。Umi-OCR 是一款免费、开源、可离线运行的 OCR光学字符识别即从图片中提取文字软件解压即用支持 Windows 和 Linux覆盖截图 OCR、批量图片识别、PDF 文档识别和二维码处理内置多国语言识别库。快速上手三步完成第一次文字识别整个流程不需要安装任何东西。第一步下载。从发行版渠道下载软件包它是.7z压缩包或.7z.exe自解压包没有装压缩软件的电脑可以直接运行自解压包。第二步打开。解压后双击Umi-OCR.exe即可启动。首次打开时界面语言会自动跟随你的系统设置之后也可以随时在全局设置里切换。第三步识别。打开截图OCR标签页用快捷键唤起截图在屏幕上框选一段区域松开鼠标识别结果就出现在右侧记录栏里可以直接划选复制。你也可以在其他地方复制一张图片粘贴到 Umi-OCR 里识别。能帮你做什么截图取字快捷键抓屏文字立刻到手网页、软件界面里的文字不能复制时你只需要一个快捷键。框选区域后Umi-OCR 自动识别并把文字按正确的阅读顺序输出。结果不满意时可以调整文本后处理里的排版解析方案就是整理识别结果的换行和段落顺序的预设规则多栏-按自然段换行适合大部分场景自动识别多栏布局单栏-保留缩进专门用于代码截图会保留行首缩进和空格。所有方案都支持横排和竖排文字。批量转文字几百张图片一次处理完当你有一整个文件夹的图片要转成文字就用批量OCR标签页。支持jpg、png、bmp、tiff、webp等常见格式没有数量上限结果可以保存为 TXT、JSONL、Markdown 或 CSVExcel 可直接打开四种格式。这里有一个很实用的功能叫忽略区域如果每张图片的固定位置都有水印或页眉页脚在忽略区域编辑器里按住右键画出矩形框这些区域的文字就不会出现在结果里。注意只有完整落在框内的文本块才会被忽略所以框尽量画大一点把水印可能出现的所有位置都包进去。文档识别PDF 扫描件变双层可搜索 PDF文档识别标签页支持pdf、xps、epub、mobi、fb2、cbz六种格式。对没有文字层的扫描件它执行 OCR 并生成双层可搜索 PDF上面是原图、下面是一层可选择的文字既能搜索又能复制对本身带文本的电子书则直接提取原有内容。同样支持忽略区域来排除页眉页脚还能在任务完成后自动关机或待机。二维码扫码和生成都在这截图、粘贴或拖入图片即可读取其中的二维码和条形码一张图里有多个码也能一次全部读出来支持 QRCode、DataMatrix、PDF417、EAN 等 19 种协议。反过来输入一段文本也能生成二维码图片支持自定义纠错等级和尺寸。从手动到自动化以上功能全部可以脚本化调用前提是在全局设置里确认 HTTP 服务已允许默认开启。它只在本地回环地址通信不经过物理网卡可以放心使用。命令行方面入口就是主程序本身常用指令如下umi-ocr --screenshot 鼠标截屏识别 umi-ocr --clipboard 识别剪贴板中的图片 umi-ocr --path D:/images 识别文件夹内所有图片 umi-ocr --screenshot --clip 识别后结果复制到剪贴板完整参数包括范围截屏、文件输出、二维码读写指令见 docs/README_CLI.md。指令还支持前缀简写比如--screenshot可以写成--sc。需要程序化集成时用 HTTP 接口更合适文档识别、图片识别、二维码读写都有对应端点详见 docs/http/README.md。想二次开发的话项目采用插件化架构OCR 引擎本身也是以插件形式提供的换引擎就是导入一个新插件无需改主程序。怎么选、怎么调⚙️引擎怎么选发行版默认搭载 RapidOCR 引擎兼容性最好Windows 7 这种老系统也能跑PaddleOCR 引擎识别速度稍快。对普通用户建议就用默认的 RapidOCR不要折腾如果你追求速度或想换引擎导入对应插件即可切换两者不要同时安装。常用配置项集中在全局设置页一键添加桌面快捷方式或开机自启切换界面语言支持繁中、英语、日语、俄语等选择亮/暗主题调整界面文字大小和字体。如果你的机器上出现截屏闪烁、UI 错位就在界面和外观里切换渲染器或关闭硬件加速试试。性能建议识别超大长图或大图时先到批量页的设置→文字识别→限制图像边长调高数值否则图片会被压缩导致识别不全批量任务支持暂停待机或休眠后可以恢复几百张图片的任务建议配合完成后自动关机/待机跑完就不用管了。避坑指南现象命令行输入后没有任何反应。原因HTTP 服务未开启或者你用的是备用启动器如RUN_GUI.bat而非主程序。解决在全局设置里确认已允许 HTTP 服务并直接用Umi-OCR.exe作为命令行入口。现象导入特别大的长图后识别内容缺失。原因图片超出了默认限制边长被自动缩小。解决在批量识别页设置→文字识别→限制图像边长里调高数值。现象命令行想用自己的或|重定向结果却收不到输出。原因运行环境限制Umi-OCR 暂时不支持系统管道重定向。解决改用内置的--output file.txt覆盖或--output_append追加输出到文件程序间调用则可用 HTTP 转发命令行接口。现象长时间、大批量调用 HTTP 接口偶尔报ECONNREFUSED。原因后端组件并发能力有限。解决避免并发调用报错后重新发起请求即可只要后台没崩就不会持续影响。现象某些显卡上截图时界面闪烁或窗口错位。原因默认的显卡加速渲染与你的环境不兼容。解决全局设置→界面和外观→渲染器切换到其他渲染方案或关闭硬件加速。社区与更新项目维护节奏比较稳每个稳定版本都有对应的备份分支改动明细都记录在 CHANGE_LOG.md 里建议升级前看一眼。界面翻译基于 Weblate 平台协作如果你会外语可以在线校对或补充语言。遇到问题先查更新日志和文档仍然解决不了就到项目 Issues 区提交 Bug作者会尽量跟进。写在最后Umi-OCR 把识别文字这件事做到了最低门槛解压、启动、框选三步就有结果想深入时命令行和 HTTP 接口也备好了。现在就下载一个发行版用截图 OCR 试一段你屏幕上的文字吧——你会发现把图片变文字真的可以这么简单。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考