ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Umi-OCR 免费离线OCR软件实战:从一摞纸质资料到可编辑文字,我只用了三分钟

Umi-OCR 免费离线OCR软件实战:从一摞纸质资料到可编辑文字,我只用了三分钟

Umi-OCR 免费离线OCR软件实战:从一摞纸质资料到可编辑文字,我只用了三分钟

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

深夜十一点,你盯着办公桌上那二十页刚打印出来的技术文档——不是电子版,是纸质的。要么一个字一个字敲进电脑,要么掏出手机拍照再手动整理。两年前的我选了后者,结果那晚我花了四个小时。

直到我遇到Umi-OCR,一款完全免费、开源、离线运行的 OCR 软件。从那以后,"图片里的文字复制不出来"这件事,从我的人生里消失了。今天这篇文章,就把我从安装到玩透它的完整路径走给你看。

一句话看懂:Umi-OCR 到底解决什么问题

如果你在办公、学习或写代码时经常遇到下面任一场景,它就是为你准备的:

  • 网页、软件界面、PDF 里的文字无法复制,只能截图
  • 一堆扫描件、照片里的文字需要变成可编辑文档
  • 想识别图片里的二维码,或者批量生成二维码
  • 手上有几百张图片要转文字,不想一张张手动处理

Umi-OCR 是一款免费、开源的离线 OCR 软件,自带离线识别引擎和多种语言库,解压即用、无需联网、不传任何数据到云端。截图识别、批量识别、PDF 文档识别、二维码扫码与生成,全都能干。和多数需要联网的在线 OCR 工具相比,它最大的不同是:数据不出本机,速度还不输在线服务。

首战速通:3 步完成第一次文字识别

先别急着研究所有功能,我们把最短路径走通,让你三分钟内获得第一次正反馈。

第一步:下载并解压

从项目仓库获取压缩包(Windows 版为.7z格式),解压到纯英文路径,例如D:\Umi-OCR。注意不要放在带中文或空格过长的目录里,避免潜在的兼容性问题。

第二步:启动软件

无需安装。解压后直接双击Umi-OCR.exe即可运行,第一次启动会自动按你系统的语言设置切换界面语言。想手动切换的话,到全局设置语言/Language里选即可。

第三步:截图识别

打开「截图OCR」标签页,按下默认快捷键Ctrl+Shift+S,用鼠标框选屏幕上任意想识别的区域,松开后文字自动提取并显示在右侧记录栏,复制即可使用。

截图识别是日常最高频的功能,框选、识别、复制三步一气呵成

看到识别结果出来的那一刻,恭喜你,已经正式上手了。

进阶玩法:4 个多数人不知道的高效技巧

基础功能会用之后,下面这几个能力才是 Umi-OCR 真正拉开差距的地方。

技巧一:用"排版解析方案"解决多栏和代码截图

同样是识别,为什么有人复制出来是乱序的,有人复制出来直接能粘贴进文档?

关键在于「截图OCR」设置里的文本后处理 - 排版解析方案。它决定识别出的文字块按什么顺序、什么方式拼接:

  • 多栏-按自然段换行:适合大部分网页、论文等双栏或多栏排版
  • 单栏-保留缩进:专门用于解析代码截图,保留行首缩进和行中空格
  • 不做处理:OCR 引擎的原始输出

如果你经常把代码截图转成文本,选单栏-保留缩进,缩进和空格会原样保留,粘贴进编辑器里直接能用。

代码截图识别配合"保留缩进"方案,还原度接近原生代码

技巧二:用"忽略区域"排掉水印和页眉页脚

批量识别扫描件时,最烦人的不是文字本身,而是图片角落的水印、LOGO、页眉页脚。它们会混进识别结果里,还得手工清理。

「批量OCR」标签页右侧设置里可以进入忽略区域编辑器,按住右键在图片上画出矩形框,把这些区域圈起来。任务执行时,完全落在框内的文本块会被直接丢弃,水印识别问题从此一劳永逸。

技巧三:二维码不仅能扫,还能批量生成

「二维码」标签页支持截图、粘贴、拖入图片识别其中的二维码和条形码,一张图多个码也能一次读出,支持 Aztec、QRCode、PDF417 等 19 种协议。

反过来,输入任意文本就能生成二维码图片,还能自定义宽高和纠错等级。生成 Wi-Fi 分享码、名片信息,都不用再求助于在线网站了。

技巧四:扫描版 PDF 一键变成可搜索文档

这是被很多人忽略的重头戏。在「文档识别」标签页拖入 PDF 扫描件,选择输出为双层可搜索 PDF——识别出的文字会被写入 PDF 底层,上层保留原图。结果就是:原本只能肉眼阅读的扫描件,现在可以全文搜索、复制、选中高亮。

支持pdf, xps, epub, mobi, fb2, cbz格式,同样可以设置忽略区域排除页眉页脚,还可以在任务完成后自动关机或休眠。

实战演练:把一整本纸质笔记搬进电脑

理论讲完了,走一遍完整的真实流程。假设你要把一本 30 页的纸质笔记变成电子版:

  1. 拍照:用手机把每一页拍下来,导入电脑放进一个文件夹
  2. 批量导入:打开「批量OCR」标签页,点「选择图片」或直接把整个文件夹拖进去,支持jpg, png, webp, bmp, tif等常见格式
  3. 忽略水印:如果照片角落有手指、阴影或水印,先进入忽略区域编辑器框选掉
  4. 设置输出:在右侧设置里选择输出格式——需要整理成文章选md,需要统计分析选csv,最通用的是txt
  5. 开始任务:点击「开始任务」,进度条实时显示处理状态,几百张图片没有数量上限,全部跑完还能自动待机

批量识别支持一次导入数百张图片,逐个显示识别结果与置信度

任务跑完后,识别记录可以直接复制,也可以按设定格式保存到指定目录。纸质笔记变成可搜索的电子文本,整个过程不用联网,隐私完全在自己手里。

避坑指南:新手最容易踩的 5 个坑

常见错误正确做法
❌ 解压到含中文的路径(如C:\用户\下载✅ 解压到纯英文路径,如D:\Umi-OCR
❌ 识别大图时发现文字丢失✅ 在批量页「设置→文字识别→限制图像边长」中调高数值
❌ 截图时界面闪烁、错位✅ 全局设置→界面和外观→渲染器,切换渲染方案或关闭硬件加速
❌ 识别结果顺序混乱✅ 根据内容形态切换排版解析方案(多栏/单栏/保留缩进)
❌ 批量识别水印干扰严重✅ 先用忽略区域把水印和页眉页脚框选掉

另外一个小提醒:软件窗口右上角可以锁定标签页,防止日常使用中误触关闭;标签栏左上角可以切换窗口置顶,边看资料边识别时非常顺手。

生态延伸:命令行和 HTTP 接口能做什么

Umi-OCR 远不止一个图形界面。它内置了完整的命令行和 HTTP 接口,让你可以把文字识别能力嵌进自己的工作流。

命令行调用:主程序Umi-OCR.exe本身就是命令行入口(需保证 HTTP 服务开启,默认开启)。

# 鼠标截屏并直接复制结果到剪贴板 umi-ocr --screenshot --clip # 指定截取范围并输出到文件 umi-ocr --screenshot screen=0 rect=50,100,300,200 --output "test.txt" # 识别指定图片或整个文件夹 umi-ocr --path "D:/img1.png" "D:/image/test" # 从文本生成二维码图片 umi-ocr --qrcode_create "https://example.com" "D:/输出图片.jpeg" 256 256

所有指令都支持简写,比如--screenshot可以简写为--sc,Linux 用户也可以用umi-ocr.sh脚本。

HTTP 接口:软件默认在http://127.0.0.1:1224提供本地接口。发一个 POST 请求带上 base64 图片,就能拿到 JSON 格式的识别结果:

import json, requests url = "http://127.0.0.1:1224/api/ocr" data = { "base64": "图片的base64编码字符串", "options": {"data.format": "text"} } response = requests.post(url, data=json.dumps(data), headers={"Content-Type": "application/json"}) print(json.loads(response.text))

接口还支持 PDF 文档识别、二维码识别/生成、参数动态查询。想深入了解,可以翻阅项目的命令行手册与 HTTP 接口文档:命令行手册位于docs/README_CLI.md,HTTP 接口手册位于docs/http/README.md

对开发者来说,这些接口意味着你可以用 Python、JavaScript 甚至任意语言,把 Umi-OCR 变成项目里的"文字识别引擎"。想从源码开始研究或二次开发,也可以用git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR拉取整个项目。

从现在开始,让图片里的文字"随取随用"

回头看这篇文章,我们其实只做了一件事:把一个"截图后手动抄写"的麻烦,替换成一个三秒出结果的快捷键。

  • 截图识别:Ctrl+Shift+S框选即识别,日常查资料最快
  • 批量处理:几百张图片或一整本扫描版 PDF,挂机跑完即可
  • 排版与忽略区域:让结果符合阅读习惯,水印干扰归零
  • 命令行与接口:把识别能力接入自己的脚本和工作流

这款免费离线 OCR 软件不需要注册、不需要联网、不需要付费,现在就可以下载来试试。建议你今天就做一件事:随手截一张经常要抄写的网页截图,按下Ctrl+Shift+S,你会立刻明白什么叫"再也回不去手动抄写了"。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表