离线文字识别实战:用Umi-OCR把截图、PDF和批量图片一键变成文字
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你是不是也经历过这样的时刻:网页上的教程文字死活复制不了,只能对着屏幕一个字一个字敲;老板丢来一份扫描版合同,说"帮忙转成Word";手机里几百张课堂笔记照片,整理到手酸。其实,这些"文字搬运"的苦活,完全可以交给一款离线文字识别工具。今天要介绍的 Umi-OCR,就是一款免费、开源、完全离线运行的 OCR 软件——解压即用,断网也能精准识别图片中的文字,堪称打工人的效率外挂。
一、两分钟上手:免安装、免联网,解压就能用
很多工具劝退新手的第一步,就是复杂的安装配置。Umi-OCR 走的是"零门槛"路线:
- 从项目仓库下载
.7z压缩包(仓库地址:https://gitcode.com/GitHub_Trending/um/Umi-OCR)。 - 解压到纯英文路径下,比如
D:\Umi-OCR,避免中文路径引发兼容问题。 - 双击
Umi-OCR.exe,软件直接启动。
整个过程不需要安装程序,不需要注册账号,更不需要联网。它内置了 PaddleOCR、RapidOCR 两套离线识别引擎和多语言识别库,识别过程完全在本机完成,敏感文档不用上传到任何服务器,隐私安全这块让人放心。
首次启动时,软件会读取你的系统语言设置,自动切换成对应界面——中、英、日、繁中等语言都内置好了,就算拿给国外同事用也不尴尬。
二、截图识别文字:快捷键框一下,三秒出结果
日常用得最多的,是"截图 OCR"这个看家本领。按下截图快捷键(默认 Ctrl+Shift+S,可在设置里改),用鼠标框选屏幕上的文字区域,识别结果立刻出现在右侧记录栏里。
几个使用小细节值得记住:
- 左侧图片预览区,可以直接用鼠标划选文字复制;
- 右侧记录栏支持编辑,可以多选几条记录一次性复制;
- 不需要截图时,直接复制一张图片粘贴进来,同样能识别;
- 识别完成后,右键菜单可以快速"复制全部""全选记录",效率拉满。
连代码都能原样"抄"回来
最让我惊喜的是它对代码截图的支持。默认的排版方案会打乱缩进,但 Umi-OCR 提供了"单栏-保留缩进"的后处理方案,能把代码截图的行首缩进、行中空格完整还原,贴回编辑器就能直接用。
除了保留缩进,排版解析还支持多栏/单栏自动识别、按自然段换行等方案,无论是报纸排版、竖排文字还是普通段落,都能整理成适合阅读的顺序。
三、批量图片转文字:几百张图,一口气处理完
当图片数量从"几张"变成"几百张",截图功能就忙不过来了。这时候切换到"批量 OCR"标签页:
- 把图片文件拖进列表(支持 jpg、png、webp、bmp、tif 等常见格式);
- 选择输出格式:TXT、JSONL、Markdown、CSV(可直接用 Excel 打开)任选;
- 点击开始,剩下的交给进度条。
这个任务没有数量上限,一次性导入几百张毫无压力,跑完还能设置自动关机或待机——晚上挂机跑任务,早上起来直接收结果,特别适合处理扫描件归档、电子书截图这类大批量场景。
水印太多?用"忽略区域"一键屏蔽
批量识别最怕遇到带水印、LOGO、页眉页脚的图片,这些文字会被当成正文一起识别出来。Umi-OCR 提供了"忽略区域"功能:按住右键在预览图上画几个矩形框,把水印可能出现的位置框住,任务执行时就会自动跳过这些区域的文字。画框时记得稍微画大一点,把水印的位移范围都包进去,效果更稳。
四、PDF 扫描件也能"开口说话":文档识别与二维码
如果你以为它只能处理图片,那就小看它了。Umi-OCR 的"文档识别"标签页支持 pdf、xps、epub、mobi 等电子书和文档格式,专门对付扫描件:
- 对纯图片扫描件执行 OCR,提取其中的文字;
- 输出为双层可搜索 PDF——上面是扫描原图,下面是隐藏文字层,既保留了原貌,又能直接 Ctrl+F 搜索;
- 同样支持忽略区域,把页眉页脚排除在外。
此外,二维码功能也值得一提:截图、粘贴或拖入一张带码的图片,软件就能读取其中的二维码/条形码,支持一图多码和 19 种编码协议;反过来,输入一段文字也能直接生成二维码图片,扫码、发码两不误。
五、进阶玩法:命令行与 HTTP 接口,把 OCR 变成"基础设施"
当你不满足于点鼠标,想把这套能力集成到自己的流程里,Umi-OCR 早就留好了后门:
- 命令行模式:
Umi-OCR.exe --folder "图片目录" --output "txt",一条命令就能批量跑完整个文件夹的识别任务,适合写进脚本定时执行; - HTTP 接口:启动服务后,其他程序可以调用本地接口发图收结果,相当于在本机搭了一个 OCR 服务,方便二次开发或和工作流工具联动。
配合"任务完成后自动关机"这类选项,完全可以把这台电脑变成一台无人值守的"文字提取工作站"。
六、把软件调成顺手的样子:语言、主题与问题自查
最后聊聊个性化。在"全局设置"页面,你可以一键添加桌面快捷方式、设置开机自启,还能切换界面语言和亮/暗主题、调整字体大小。
如果遇到两个小问题,也可以在这里解决:
- 截屏闪烁或界面错位:多半是显卡渲染兼容性问题,到"界面和外观 → 渲染器"里换个渲染方案,或直接关闭硬件加速;
- 超大长图识别失败:在批量页设置里调高"限制图像边长"的数值即可。
另外,Umi-OCR 支持中、英、日、繁中等多种界面语言,第一次打开会自动跟随系统语言,想手动切换就去全局设置里找"语言/Language"。
写在最后
从截屏提取、批量转文字,到 PDF 扫描件检索、二维码收发,再到命令行和 HTTP 接口的自动化集成,Umi-OCR 把"离线文字识别"这件事做到了"免费 + 开源 + 省心"三个词。它不联网、不上传,保护隐私的同时也彻底告别了网速和账号的限制。
如果你也受够了手敲文字的苦,不妨去项目仓库下载一个试试(地址:https://gitcode.com/GitHub_Trending/um/Umi-OCR)。它完全免费,代码全部开源,喜欢的话顺手点个 Star,就当是给开发者的一份鼓励。把重复劳动交给工具,把时间留给真正重要的事,这大概就是效率工具最大的意义。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考