免费离线 OCR 软件 Umi-OCR 完整指南:10 分钟从截图识别到 PDF 双层文本
2026/9/19 1:47:12 网站建设 项目流程

免费离线 OCR 软件 Umi-OCR 完整指南:10 分钟从截图识别到 PDF 双层文本

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

周五下午五点半,一份 200 页的扫描合同压在桌上:在线 OCR 网站的免费额度刚好用完,付费版报价 300 多一年,单位电脑又装了管控软件,图片传不出去——活卡在这儿,就得干到晚上。

破局的不神秘:Umi-OCR是一款开源、免费、纯离线的 OCR 软件,绿色解压即用,截图识别、批量图片、PDF 文档一次覆盖。

价值速览:60 秒把选型账算清楚

别绕弯子,先把账算清楚,能帮你避开那些"用了一半才发现要联网"的方案。

对比维度Umi-OCR在线免费 OCR 网站付费商用 OCR
费用完全免费,代码开源限次数,超出要付费按年订阅,不便宜
网络依赖全程离线,图片不出本机图片要上传服务器一般需联网
隐私文件只留在本地敏感内容存在泄露风险取决于服务商
典型场景截图 / 批量 / PDF / 二维码多为单张网页图功能全但贵
上手方式解压双击即用浏览器打开安装 + 授权

表下划三个重点,落点都很具体:

  • 它是绿色软件——解压后双击Umi-OCR.exe直接跑,没有安装向导,也没有激活码。
  • 引擎和语言模型全部内置:离线可用,中文、日文、韩文、英文、俄文等模型随你切换,不用单独下依赖。
  • PDF 能输出双层可搜索 PDF:给扫描件塞一层隐形文字,之后全文可搜、可复制,这条大部分免费工具没有。

最短上手路径:10 分钟复制出第一行文字

这一节只讲一条最短路径——从下载包到复制出第一行文字,10 分钟封顶,别的先别管。

  1. 下载.7z压缩包(没有解压工具就选.7z.exe自解压包)。
  2. 解压到任意目录,双击Umi-OCR.exe启动。首次打开自动跟随系统语言,中文用户零配置。
  3. 切到"截图 OCR"标签页,按下全局快捷键唤起截图框。
  4. 框选屏幕上任意一段文字,松手——识别结果自动出现在右侧记录面板。
  5. 在记录面板里编辑文字,或Ctrl+C复制走。

第一次截图识别通常十几秒出结果。到这里你只用了 10 分钟,日常 80% 的"图里字变文本"需求已经覆盖了。💡

按场景进阶:四种高频用法逐项拆

跑通第一张截图之后,剩下的场景按你实际会遇到的样子拆——每种情况给一套精确到设置项的调法。

排版解析:双栏论文和代码截图输出不乱序

什么时候用得上:多栏论文、竖排古文、带缩进的代码截图,默认逐块输出的文字经常读起来血压升高——左栏读到一半,右栏的字就插进来了。

怎么设:在"设置"里找到"文本后处理 → 排版解析方案",从 6 个预设里挑。双栏选多栏-按自然段换行,代码截图选单栏-保留缩进,它专门保留行首缩进和行中空格。横排、竖排都能自动处理。

拿到什么:输出按阅读顺序重排,代码截图的层级和空格完整还原,直接粘进编辑器就能用。

批量图片识别:一个文件夹几百张图一晚跑完

什么时候用得上:一个文件夹里几十上百张截图,一张张截太慢,图片里还带着固定位置的水印。

怎么设:切到"批量 OCR"标签页,把图片拖进列表(支持 jpg、png、webp、bmp、tif 等 9 种格式),点"开始任务"。水印固定位置的话,用"忽略区域":按住右键画矩形框,框内的文字整块跳过。结果可存txt / jsonl / md / csv(Excel),还能勾"完成后自动关机"。

拿到什么:几百张图挂机跑完,第二天直接收一个结果文件,按文件名一一对应,不用自己拼。

PDF 文档识别:扫描件输出双层可搜索 PDF

什么时候用得上:一份扫描版 PDF,用鼠标划不到字,复制出来是空的——它只有图像层,没有文本层。

怎么设:把 pdf、xps、epub、mobi 等文件拖进"文档识别"页。原生有文字层的直接提取,扫描图片走 OCR。输出勾选双层可搜索 PDF,再配合忽略区域把页眉、页脚、红章框掉。

拿到什么:一份嵌了"隐形文字层"的新 PDF,全文可搜、可复制、可划选,旧扫描件从此能核对、能检索。

命令行调用:把 OCR 识别塞进自动化脚本

什么时候用得上:识别任务要嵌进脚本或自己的程序里,不想每次点界面。

怎么设:说白了,Umi-OCR 这时候就是个本地 OCR 引擎,命令行入口就是主程序Umi-OCR.exe。一条指令识别整个文件夹并写出结果:

umi-ocr --path "D:/扫描件" --output "结果.txt"

HTTP 接口则供其他程序调用:上传文件拿任务 ID、轮询结果、下载生成文件。完整参数和示例在 HTTP 接口手册,命令行全部指令见 命令行手册。

高频翻车点:四个坑的精确改法

直说,新手前两周撞上的坑基本就这四个,每个都给了精确到设置项的改法。

坑一:大长图识别总丢字、卡顿现象:截一张网页长图或大尺寸海报,结果残缺,中间大段文字没了。 原因:默认"限制图像边长"是 960 像素,超大图被压缩过度,细节丢了。 怎么改:批量页"设置 → 文字识别 → 限制图像边长"调到2880,这是质量和速度的平衡点,再往上到 4320 会明显变慢(PaddleOCR 引擎下生效)。

坑二:水印、页眉页脚混进结果现象:批量识别论文,每页顶部的栏目标题原样出现在结果里。 原因:干扰区域没排除,OCR 不区分"正文"和"页眉"。 怎么改:用忽略区域画矩形框住页眉页脚,框尽量画大、完全包住水印可能出现的位置。注意它忽略的是整个文本块,不是单个字符——框住半行字,那一行可能整段消失。

坑三:PDF 复制出来是空白或乱码现象:打开 PDF 想复制文字,鼠标选不中任何内容。 原因:这是纯扫描件,根本没有文本层,复制无物可取。 怎么改:拖进"文档识别"页,输出双层可搜索 PDF,一次性解决。

坑四:双栏论文识别后顺序错乱现象:左栏读到一半,右栏的字插进来,段落完全串行。 原因:默认排版方案不识别多栏布局,按像素位置从上到下排。 怎么改:排版解析方案选多栏-按自然段换行,让它按阅读顺序重排再输出。

交到你手里:现在就能做的三件事

回到周五那份 200 页的扫描合同:现在直接拖进"文档识别"页,勾双层 PDF,忽略区域框掉两处红章,几分钟就能拿到一份能搜、能复制、能核对的新文件,全程断网,文件没离开过这台电脑。

接下来按顺序做三件事:

  1. 下载.7z包,解压,双击Umi-OCR.exe启动。
  2. 跑一次截图识别:快捷键框选一段屏幕文字,复制出你的第一个结果。
  3. 试一个进阶:把一个 PDF 拖进"文档识别"页,输出双层可搜索 PDF。

还想深入的话:命令行玩法看 命令行手册,版本演进看 更新日志。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询