Umi-OCR 离线文字识别指南:截图识别、批量图片识别、扫描件转可搜索 PDF
2026/9/19 12:50:49 网站建设 项目流程

Umi-OCR 离线文字识别指南:截图识别、批量图片识别、扫描件转可搜索 PDF

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

在线 OCR 网站的免费次数半天就用光;内网、断网环境里的图片,根本传不上云;付费工具还要按年订阅。Umi-OCR 是一款开源免费的离线文字识别工具:解压即用、免安装、不联网。截图、批量图片、扫描版 PDF 全在本地识别,结果直接复制、直接导出。这篇攻略带你从下载到拿到第一个识别结果,并讲清排版解析、命令行、HTTP 接口三种进阶用法。

30 秒看清新

Umi-OCR 是一款开源免费的 OCR 软件,支持 Windows x64(可下探 Win7)与 Linux x64,内置 PaddleOCR、RapidOCR 两套离线引擎和多语言识别库。

  • 免费、免安装:代码全部开源,绿色便携,解压后双击Umi-OCR.exe直接运行
  • 全程离线:图片和文档数据完全不出本机,内网、断网环境也能照常识别
  • 不止"识别":还能输出双层可搜索 PDF,让旧扫描件可全文搜索、可划选、可复制

零成本、解压即用、数据不出本机,这三件事同时成立,在免费 OCR 工具里不多见。

从 0 到第一个离线文字识别结果

  1. 下载发行版:.7z压缩包或.7z.exe自解压包(后者没装压缩软件也能用)
  2. 解压,双击Umi-OCR.exe启动(Linux 用umi-ocr.sh);首次打开,界面语言自动跟随系统
  3. 打开「截图 OCR」标签页
  4. 按下软件的截图快捷键唤起选框,框住一段文字后松手
  5. 在右侧「记录」面板里编辑结果,右键「复制」带走

到这里只花了约 5 分钟 💡:从下载到复制出第一段文字,没有注册、没有联网、没有安装向导。

按场景挑着看

屏幕文字:截图 OCR 操作步骤

入口是「截图 OCR」标签页。截图松手后,左侧是图片预览(可直接用鼠标划选文字),右侧是识别记录;记录支持编辑,右键可「复制」(Ctrl+C)或「全选」(Ctrl+A),还能选中多条记录一次复制。在别处复制的图片,也能直接粘贴进 Umi-OCR 识别。

小坑提醒:截网页长图或大海报时如果丢字,把该页设置里的「限制图像边长」调高(默认 960,2880 是质量与速度的平衡值,该参数仅对 PaddleOCR 引擎生效)。

本地图片:Umi-OCR 批量图片识别步骤

入口是「批量 OCR」标签页。把图片拖进列表(支持 jpg、png、webp、bmp、tif 等格式),点「开始任务」,列表里能看到每张图的耗时和置信度(如 0.92)。结果可保存为txt/jsonl/md/csv(Excel)任选格式;数量没有上限,几百张图一次跑完,还支持任务完成后自动关机/待机,晚上挂机、次日收结果。

图片带水印或 LOGO 时,在右侧设置进入忽略区域编辑器,按住右键画矩形框,框内文字不参与输出;注意被忽略的是整个文本块,不是单个字符。

小坑提醒:批量识别带同款水印的论文时,矩形框画大一点,完全包裹住水印可能出现的位置。

文档 / PDF:扫描件转可搜索 PDF

入口是「文档识别」标签页,支持pdfxpsepubmobifb2cbz。拖入文档:原生文字直接提取,扫描页走 OCR 识别,并可输出双层可搜索 PDF——给扫描件加上隐形文字层后,全文可搜索、可复制、可划选。同样支持设置忽略区域,排除页眉、页脚、水印;任务完成后可自动关机。

小坑提醒:PDF 里复制不出任何文字,说明它是纯扫描件、没有文本层,走一遍「文档识别」输出双层 PDF 就一劳永逸。

想更进一步

排版解析:多栏论文、竖排文字、代码截图都有现成方案。「文本后处理」设置里提供 6 种预设排版解析方案——多栏文档选「多栏-按自然段换行」,代码截图选「单栏-保留缩进」(保留行首缩进和行中空格);所有方案都能自动处理横排与竖排(从右到左)的排版。

命令行:调用入口就是Umi-OCR.exe主程序本身(备用启动器不可用命令行),HTTP 服务默认开启,一条命令批量识别整个文件夹:

umi-ocr --path "D:/scans" --output "D:/result.txt"

全部参数见 docs/README_CLI.md。

HTTP 接口:适合供其他程序调用。流程是"上传文件获取任务 ID → 轮询任务状态 → 下载生成文件",文档识别、二维码也有专门接口,详见 docs/http/api_doc.md。

全局设置:桌面快捷方式、开机自启、界面语言与主题、OCR 引擎插件切换都在这一页完成。

排版解析管"读得顺",命令行和接口管"接得上"——截图、脚本、外部程序调用的都是同一个本地 OCR 引擎,附加配置只有全局设置里的 2 个开关。

常见问题

问:识别大图、长图时丢字、结果残缺?答:在对应页面「设置 → 文字识别 → 限制图像边长」把数值调高,2880 是平衡点。默认 960 像素会把超大图压缩过度,信息直接压没了。

问:多栏文档识别后顺序错乱,左右栏串行?答:在「排版解析方案」里选「多栏-按自然段换行」,文本会按阅读顺序重排。默认方案不区分多栏布局,左右栏才会交替输出。

问:PDF 里复制出来的全是乱码或空白?答:这份 PDF 是纯扫描件、没有文本层,用 Umi-OCR 的「文档识别」跑一遍并输出双层可搜索 PDF,之后搜索、复制都正常。

问:命令行指令umi-ocr没有反应?答:入口必须是Umi-OCR.exe本体,并确认「全局设置」中 HTTP 服务处于开启状态(默认开启)、主机选「仅本地」。命令行是靠本地回环的 HTTP 接口与后台进程通信,这个服务关了是最常见的原因。

你遇到的问题大概率就是这 4 个,全部能在 1–2 次设置点击内解决,不用翻源码。

现在动手

  1. 下载并解压发行版,双击Umi-OCR.exe启动
  2. 跑一次截图 OCR:快捷键框选,复制识别结果
  3. 再试一个进阶场景:把一个 PDF 拖进「文档识别」,或把一个文件夹丢给命令行

更多资料:README.md(功能一览)· docs/README_CLI.md(命令行手册)· docs/http/api_doc.md(HTTP 接口)· CHANGE_LOG.md(更新日志)

想深入源码二次开发:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询