Umi-OCR 完整指南:5步搭建一套完全离线OCR识别工作流
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源免费的桌面OCR软件,能截图取字、批量识别图片、处理PDF文档,还能扫描和生成二维码。它全程离线运行,无需联网,图片数据不出本机,适合需要把纸质材料数字化的办公用户,也适合想把OCR嵌进自动化流程的开发者——凡是不想把文件传上云就能取到文字的场景,都可以考虑它。
快速上手:从零到跑起来
- 确认环境:Windows 7 x64 或 Linux x64,从发行版下载
.7z压缩包。 - 解压到固定目录(如
D:\Umi-OCR),无需安装。 - 启动:Windows 双击
Umi-OCR.exe;Linux 在目录下运行umi-ocr.sh。 - 首次启动的界面语言跟随系统,不合适时在"全局设置 → 语言"调整。
- 在终端执行
umi-ocr --help,能打印指令列表即说明命令行通道就绪。
核心功能走查
📸 截图取字:框选即复制
截图OCR页是使用频率最高的入口。打开该页,按截图快捷键框选区域,识别结果立刻进入右侧"记录"栏;别处复制的图片也可以直接粘贴进页面识别。预览区和记录栏都支持划选复制,整个流程就是"框选 → 复制 → 粘贴到目标处",比手动重打快得多。
批量图片识别:百张图进、一个txt出
批量页接受 jpg、png、webp、bmp、tiff 等格式,数量没有上限。加入任务后选择输出格式 txt、jsonl、md、csv,左侧列表逐文件显示耗时与状态,右侧汇总全部文本一键导出。几百张图片,跑完一次任务即可。
文档与二维码识别
文档页吃下 pdf、xps、epub 等格式的扫描件,输出双层可搜索PDF:原图依旧能看,文字也能选中复制。二维码页可扫可生成 19 种码制,一张图里多个码也能同时读出。
实战场景演练
扫描件合同数字化
痛点:扫描版PDF无法复制,关键数字只能手敲。 操作:把PDF加入文档识别页,选双层可搜索PDF输出,开始任务。 结果:生成的文档上层图像、下层文本,可全选、可搜索、可复制。
批量图片去水印
痛点:图片角落的固定水印混进识别结果。 操作:在批量页右栏"忽略区域"编辑器中,按住右键绘制多个矩形框,完全覆盖水印可能出现的区域。 结果:区域内的文本块整体跳过,正文不受影响,结果干净。
把截图取字嵌进脚本
痛点:自动化流程里每次手动截图取字太慢。 操作:保持HTTP服务开启(见 HTTP接口手册),脚本里调用umi-ocr --screenshot --clip。 结果:框选后文本自动进剪贴板,配合热键工具就是一键取字。
代码截图识别
痛点:代码被识别得面目全非,粘进编辑器就报错。 操作:文本后处理方案选"单栏-保留缩进"。 结果:行首缩进和空格保留,代码粘贴即可运行。
效率与进阶技巧
一键桌面快捷方式与自启配置
"全局设置 → 快捷方式"里勾选桌面、开始菜单或开机自启,下次打开系统菜单就有入口,不必再翻安装目录。
⚡ 命令行别名配置
在~/.bashrc里加一条别名,之后敲ocr即启动,ocr --path "D:/img"可直接识别指定图片,完整参数见 命令行手册。
alias ocr="/opt/Umi-OCR/umi-ocr.sh"多语言界面设置
界面支持简中、繁中、英语、日语等,首次启动自动匹配;要手动换语言,进"全局设置 → 语言"改完重启即可。
渲染器切换
截屏操作时若出现画面闪烁或UI错位,到"界面和外观 → 渲染器"换一种渲染方案,或关闭硬件加速再试。
常见问题速查
- 长图识别失败:图片超出"限制图像边长"阈值 → 在批量页设置→文字识别中调高该数值。
- 命令行无响应:HTTP服务未开启 → 全局设置里启用服务,主机选"仅本地"即可。
- 识别结果排版错乱:未选后处理方案 → 按实际版面选择多栏或单栏方案,竖排文字还需引擎本身支持。
- 截图时屏幕闪烁:显卡加速渲染不兼容 → 在全局设置切换渲染器。
收尾
- 解压即用、完全离线,图片与识别结果不出本机。
- 截图OCR管快速取字,批量页管大批量数字化,忽略区域管去水印和页眉页脚。
- 双层可搜索PDF能把扫描件变成可检索的文本资料。
- 命令行与HTTP接口让Umi-OCR成为脚本里可调用的OCR组件。
- 设置写在
UmiOCR-data/.settings文件里,备份它即可完成配置迁移。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考