ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Umi-OCR:三步把扫描PDF变成可搜索文档

Umi-OCR:三步把扫描PDF变成可搜索文档 Umi-OCR三步把扫描PDF变成可搜索文档【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR面对一份两百页的扫描论文想搜一个关键词却搜不到逐页复制粘贴更是无从下手。Umi-OCR 是一款开源、免费的离线文字识别OCR软件截图、批量图片、PDF 文档都能识别。它全程本地运行、无需联网识别模型内置在软件里隐私和速度都掌握在你自己手中。项目画像解决什么问题把图片、扫描件里的文字变回可编辑文本把扫描 PDF 变成可搜索的双层 PDF。差异点完全离线支持截屏、批量、PDF 三类识别外加二维码扫描与生成。平台Windows 7 x64 及以上、Linux x64解压即用零安装。协议MIT 开源协议LICENSE 可查可自由使用与修改。模型库内置简中、英、日、韩等多国语言识别库无需额外配置。快速上手最短路径三步获取 → 启动 → 识别。方式一推荐新手从仓库发行版下载.7z压缩包解压后直接运行Umi-OCR.exe全程不装任何东西。方式二从源码获取git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR启动后你会看到标签栏默认打开截图OCR页左侧是图片预览栏右侧是设置/记录两个选项卡。语言会根据系统自动切换想手动改就在全局设置里选。第一次操作建议走截图流程在截图OCR页按默认快捷键框选一块屏幕文字右侧立刻出现识别结果点复制即可粘贴。到这里软件就跑起来了。核心能力拆解当你要从屏幕上抠一段文字时截图OCR看教程、读外文网页屏幕上有一段文字想存下来——这就是截图OCR的场景。打开截图OCR标签页按快捷键或点页面上的截图按钮唤起截图鼠标框选文字区域左侧预览图会标出识别到的文字块直接鼠标划选即可复制右侧记录栏保留每次识别结果支持划选多条合并复制技巧在页内设置里切换排版解析方案。解析代码截图时选单栏-保留缩进行首空格能原样保留多栏论文选多栏-按自然段换行阅读顺序自动排好。当你要处理上百张截图时批量识别截图散落在几个文件夹里一张张复制不现实。批量OCR页就是为此设计的。打开批量OCR标签页点选择图片导入文件支持 jpg、png、webp、bmp、tif 等 9 种格式几百张也没有数量上限点开始任务顶部进度条实时显示已处理数量、耗时和状态结果按你勾选的格式保存txt、jsonl、md、csvExcel任务跑完可选择自动关机适合晚上挂机处理技巧图片带固定水印在右栏设置里打开忽略区域编辑器按住右键把水印位置框成矩形框内文字会被整体跳过几百张图只需画一次。当你要扫描PDF转可搜索文档时文档识别这是解决PDF 有图无字的主力功能输入支持 pdf、xps、epub、mobi、fb2、cbz 六种格式。打开文档识别标签页导入 PDF扫描件会被逐页 OCR已有文本层的 PDF 直接提取选择保存为双层可搜索PDF图像层保留原版式文本层透明可搜可复制可先设定忽略区域把页眉、页脚、水印从结果里剔除长任务可设置完成后自动休眠技巧页脚日期每页都混进搜索结果把忽略区域画在页脚位置再开任务比事后手动删干净得多。当你要扫个码或生成二维码时二维码页办公场景的顺手功能识别与生成合在一页。打开二维码标签页截图、粘贴或拖入图片支持一张图里多个码覆盖 Aztec、DataMatrix、QRCode 等 19 种协议反过来也能用输入文本指定纠错等级生成二维码图片进阶配置与效率技巧图像边长限制默认会压缩超大图片再识别。要识别超长图时进页面设置 → 文字识别 → 限制图像边长把数值调高否则长图会被截断。排版解析方案预设了多栏/单栏共 6 种换行策略另加不做处理输出引擎原始结果。同一份文档换不同方案对比一遍通常能明显提升可读性。切换 OCR 引擎软件支持 Rapid-OCR 与 Paddle-OCR 两种离线引擎在全局设置里切换。前者兼容性好后者速度稍快不同字体下表现有差异值得按自己的文档试一轮。界面与渲染语言、亮/暗主题、字体和界面缩放都在全局设置里。若截图时界面闪烁或 UI 错位到界面和外观切换渲染器或关闭硬件加速。场景延伸学术文献扫描版古籍和老论文无法检索跑一遍文档识别得到可全文搜索的双层 PDF引用和查词效率直接翻倍。办公档案合同、发票扫描件堆在共享盘批量OCR一次转出 txt/csv金额、日期进表格就能核对不用人工敲字。个人学习外文教材截图看不懂排版截图OCR选多栏方案按自然段输出外语资料识别直接切换对应语言库。项目生态技术栈Python QtPyStand 定制版构建源码在UmiOCR-data/py_src界面资源在UmiOCR-data/qt_res插件机制独立于主程序。协作界面翻译在 Weblate 平台协作覆盖繁中、英语、日语、俄语等十余种语言问题与需求走仓库 Issue。接口命令行与 HTTP 接口均内置适合写进脚本或接入自动化流程见 命令行手册 与 HTTP接口手册。避坑指南截图识别偶发模糊或界面闪烁处理多半是硬件加速渲染的问题去全局设置 → 界面和外观 → 渲染器换一个方案或关闭加速。超长图片识别结果缺字处理是图像边长限制在压缩大图。进页面设置把限制图像边长调高后再识别。批量结果里混进水印、页脚文字处理开忽略区域把固定位置框成矩形。注意只有整个文本块落在框内才会被忽略框尽量画大一点。命令行调用没反应处理命令行依赖软件内置的 HTTP 服务跨进程通信仅本地回环默认开启。确认全局设置里 HTTP 服务为允许状态主机选仅本地即可。Umi-OCR 的核心价值一句话文字识别、PDF 转换全程离线数据不出你的电脑。它适合需要隐私、需要批量、需要零成本的场景如果你追求手写潦草体的极致准确率它可能不是第一选择可以先拿自己的文档试一轮。仓库里更新日志、翻译平台都是开放入口用着顺手就去提个 Issue 或参与翻译让它更像你要用的样子。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表