免费离线 OCR 软件 Umi-OCR 完整指南:10 分钟从截图识别到 PDF 双层文本
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
周五下午五点半,一份 200 页的扫描合同压在桌上:在线 OCR 网站的免费额度刚好用完,付费版报价 300 多一年,单位电脑又装了管控软件,图片传不出去——活卡在这儿,就得干到晚上。
破局的不神秘:Umi-OCR是一款开源、免费、纯离线的 OCR 软件,绿色解压即用,截图识别、批量图片、PDF 文档一次覆盖。
价值速览:60 秒把选型账算清楚
别绕弯子,先把账算清楚,能帮你避开那些"用了一半才发现要联网"的方案。
| 对比维度 | Umi-OCR | 在线免费 OCR 网站 | 付费商用 OCR |
|---|---|---|---|
| 费用 | 完全免费,代码开源 | 限次数,超出要付费 | 按年订阅,不便宜 |
| 网络依赖 | 全程离线,图片不出本机 | 图片要上传服务器 | 一般需联网 |
| 隐私 | 文件只留在本地 | 敏感内容存在泄露风险 | 取决于服务商 |
| 典型场景 | 截图 / 批量 / PDF / 二维码 | 多为单张网页图 | 功能全但贵 |
| 上手方式 | 解压双击即用 | 浏览器打开 | 安装 + 授权 |
表下划三个重点,落点都很具体:
- 它是绿色软件——解压后双击
Umi-OCR.exe直接跑,没有安装向导,也没有激活码。 - 引擎和语言模型全部内置:离线可用,中文、日文、韩文、英文、俄文等模型随你切换,不用单独下依赖。
- PDF 能输出双层可搜索 PDF:给扫描件塞一层隐形文字,之后全文可搜、可复制,这条大部分免费工具没有。
最短上手路径:10 分钟复制出第一行文字
这一节只讲一条最短路径——从下载包到复制出第一行文字,10 分钟封顶,别的先别管。
- 下载
.7z压缩包(没有解压工具就选.7z.exe自解压包)。 - 解压到任意目录,双击
Umi-OCR.exe启动。首次打开自动跟随系统语言,中文用户零配置。 - 切到"截图 OCR"标签页,按下全局快捷键唤起截图框。
- 框选屏幕上任意一段文字,松手——识别结果自动出现在右侧记录面板。
- 在记录面板里编辑文字,或
Ctrl+C复制走。
第一次截图识别通常十几秒出结果。到这里你只用了 10 分钟,日常 80% 的"图里字变文本"需求已经覆盖了。💡
按场景进阶:四种高频用法逐项拆
跑通第一张截图之后,剩下的场景按你实际会遇到的样子拆——每种情况给一套精确到设置项的调法。
排版解析:双栏论文和代码截图输出不乱序
什么时候用得上:多栏论文、竖排古文、带缩进的代码截图,默认逐块输出的文字经常读起来血压升高——左栏读到一半,右栏的字就插进来了。
怎么设:在"设置"里找到"文本后处理 → 排版解析方案",从 6 个预设里挑。双栏选多栏-按自然段换行,代码截图选单栏-保留缩进,它专门保留行首缩进和行中空格。横排、竖排都能自动处理。
拿到什么:输出按阅读顺序重排,代码截图的层级和空格完整还原,直接粘进编辑器就能用。
批量图片识别:一个文件夹几百张图一晚跑完
什么时候用得上:一个文件夹里几十上百张截图,一张张截太慢,图片里还带着固定位置的水印。
怎么设:切到"批量 OCR"标签页,把图片拖进列表(支持 jpg、png、webp、bmp、tif 等 9 种格式),点"开始任务"。水印固定位置的话,用"忽略区域":按住右键画矩形框,框内的文字整块跳过。结果可存txt / jsonl / md / csv(Excel),还能勾"完成后自动关机"。
拿到什么:几百张图挂机跑完,第二天直接收一个结果文件,按文件名一一对应,不用自己拼。
PDF 文档识别:扫描件输出双层可搜索 PDF
什么时候用得上:一份扫描版 PDF,用鼠标划不到字,复制出来是空的——它只有图像层,没有文本层。
怎么设:把 pdf、xps、epub、mobi 等文件拖进"文档识别"页。原生有文字层的直接提取,扫描图片走 OCR。输出勾选双层可搜索 PDF,再配合忽略区域把页眉、页脚、红章框掉。
拿到什么:一份嵌了"隐形文字层"的新 PDF,全文可搜、可复制、可划选,旧扫描件从此能核对、能检索。
命令行调用:把 OCR 识别塞进自动化脚本
什么时候用得上:识别任务要嵌进脚本或自己的程序里,不想每次点界面。
怎么设:说白了,Umi-OCR 这时候就是个本地 OCR 引擎,命令行入口就是主程序Umi-OCR.exe。一条指令识别整个文件夹并写出结果:
umi-ocr --path "D:/扫描件" --output "结果.txt"HTTP 接口则供其他程序调用:上传文件拿任务 ID、轮询结果、下载生成文件。完整参数和示例在 HTTP 接口手册,命令行全部指令见 命令行手册。
高频翻车点:四个坑的精确改法
直说,新手前两周撞上的坑基本就这四个,每个都给了精确到设置项的改法。
坑一:大长图识别总丢字、卡顿现象:截一张网页长图或大尺寸海报,结果残缺,中间大段文字没了。 原因:默认"限制图像边长"是 960 像素,超大图被压缩过度,细节丢了。 怎么改:批量页"设置 → 文字识别 → 限制图像边长"调到2880,这是质量和速度的平衡点,再往上到 4320 会明显变慢(PaddleOCR 引擎下生效)。
坑二:水印、页眉页脚混进结果现象:批量识别论文,每页顶部的栏目标题原样出现在结果里。 原因:干扰区域没排除,OCR 不区分"正文"和"页眉"。 怎么改:用忽略区域画矩形框住页眉页脚,框尽量画大、完全包住水印可能出现的位置。注意它忽略的是整个文本块,不是单个字符——框住半行字,那一行可能整段消失。
坑三:PDF 复制出来是空白或乱码现象:打开 PDF 想复制文字,鼠标选不中任何内容。 原因:这是纯扫描件,根本没有文本层,复制无物可取。 怎么改:拖进"文档识别"页,输出双层可搜索 PDF,一次性解决。
坑四:双栏论文识别后顺序错乱现象:左栏读到一半,右栏的字插进来,段落完全串行。 原因:默认排版方案不识别多栏布局,按像素位置从上到下排。 怎么改:排版解析方案选多栏-按自然段换行,让它按阅读顺序重排再输出。
交到你手里:现在就能做的三件事
回到周五那份 200 页的扫描合同:现在直接拖进"文档识别"页,勾双层 PDF,忽略区域框掉两处红章,几分钟就能拿到一份能搜、能复制、能核对的新文件,全程断网,文件没离开过这台电脑。
接下来按顺序做三件事:
- 下载
.7z包,解压,双击Umi-OCR.exe启动。 - 跑一次截图识别:快捷键框选一段屏幕文字,复制出你的第一个结果。
- 试一个进阶:把一个 PDF 拖进"文档识别"页,输出双层可搜索 PDF。
还想深入的话:命令行玩法看 命令行手册,版本演进看 更新日志。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考