Umi-OCR:截图取字、批量图片识别、PDF 扫描件,3 个本地 OCR 任务一网打尽,不联网不花钱
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费开源的离线 OCR 软件。截图取字、整文件夹图片批量识别、扫描版 PDF 变可搜索文档,全在本地处理,无需联网,图片不离开你的机器。读完全文,你可以独立做完四件事:走通一次"截图 → 识别 → 复制",把一文件夹图片导出成 txt/Excel,把文档变成双层可搜索 PDF,以及把识别能力接进自己的脚本和 Web 服务。
主界面:左侧是截图预览,可直接划选文字;右侧按时间排列每次识别的记录
先跑通一次:完成第一张截图 OCR
- 解压发布包。发布版是
.7z压缩包(或自解压的.7z.exe),Windows 7 x64 与 Linux x64 均可运行,没有安装器。你会看到一个完整的目录,里面就是全部文件。 - 启动程序。Windows 上双击
Umi-OCR.exe,Linux 上执行umi-ocr.sh。你会看到主窗口弹出,界面语言跟随系统设置走。 - 唤起截图。打开"截图 OCR"标签页,按下快捷键(可在该页设置里改),用鼠标框选一块文字区域。你会看到屏幕变暗、出现选框,随时能按
Esc取消。 - 复制文字。识别跑完后,右侧"记录"栏多出一条文本,点一下记录即可复制;左侧预览图上也能直接划选字符。
最短闭环到此就通了。顺手可以进"全局设置"标签页切换语言、主题、开自启:
全局设置页:切换界面语言与主题,或添加桌面快捷方式、开机自启
任务A|截图 OCR 取字:排版怎么配才不乱
要什么:文档截图、视频帧里的代码,你想原样贴进 IDE。手敲太慢,普通 OCR 又容易吞掉缩进和行内空格。
怎么做:
- 在"截图 OCR"标签页框选代码区域。
- 右侧"设置"面板中,把排版解析切到单栏-保留缩进。
- 识别结束后,在右侧记录中点这条结果复制。
怎么算成了:把结果贴进 IDE 或 Markdown 预览,缩进层级和原图一致、没有多余空格,就算过关。
别栽在这:默认排版解析是"多栏-按自然段换行",面向普通文档。套在代码截图上,缩进会被拍平。OCR 引擎只管认字,把字块按阅读顺序拼回去靠的是排版解析,方案选错结果就不对味。
截图 OCR 页面:左侧预览栏可划选文字,右侧记录栏按时间保存每次识别结果
记录面板还能划选多条记录批量复制,也可以编辑文字后再复制:
识别记录面板:右键菜单可复制、删除单条记录或清空全部
任务B|批量导出 txt 和 Excel:一文件夹图片或一整个 PDF 一次出结果
要什么:手里有一堆扫描文档、票据或拍照图片,一张一张点不现实。
怎么做:
- 切到"批量 OCR"标签页,点"选择图片"或直接拖入文件夹,几百张也能一次导入。
- 核对输入格式
jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff,输出勾选txt / jsonl / md / csv (Excel)。 - 点"开始任务"。你会看到左侧列表逐张显示耗时和置信度,任务结束得到每个文件对应的输出。
怎么算成了:随机抽 3 张图,对比左侧预览和右侧记录;置信度(0~1)低于0.8的那几张,重点人工核对。
别栽在这⚠️:
- 每张图固定位置都有水印或 LOGO 时,在右侧设置进入忽略区域编辑器,按住右键画矩形框住它。只有完整落在框内的文本块会被丢弃,框画得稍大一点更安全。
- 像素超大的长图、小字多的大图,到"设置 → 文字识别 → 限制图像边长"把数值调高(默认
960,可选2880或4320),否则大图先被压缩,小字容易糊。
批量 OCR 页面:左侧是待识别文件列表(含耗时、置信度),右侧是识别记录
PDF 扫描件走同一套思路:切到"文档识别"标签页(v2.1.4及以上版本支持),拖入文档,支持pdf / xps / epub / mobi / fb2 / cbz,同样可以设忽略区域排除页眉页脚。产物是双层可搜索 PDF:原图垫底,识别出的文字藏在上层,能搜能选,版面不损失。打开生成的 PDF,用Ctrl+F搜一个只在正文里出现的词,能直接跳到对应页,就说明文字层写对了。
任务C|把 OCR 挂进自动化:命令行和 HTTP 两条路
要什么:你想把 OCR 塞进定时任务、打包脚本或自己的 Web 服务。
怎么做:
- 在"全局设置"里确认 HTTP 服务已开启,主机保持"仅本地"即可,默认端口
1224。 - 命令行走法(
umi-ocr是Umi-OCR.exe的简写),完整用法看 命令行手册:
umi-ocr --screenshot --clip umi-ocr --path "D:/docs" --output "结果.txt" umi-ocr --qrcode_read "D:/code.png"- HTTP 走法:先
GET http://127.0.0.1:1224/api/ocr/get_options查参数定义,再POST http://127.0.0.1:1224/api/ocr提交 base64 图片。请求体是 JSON,图片编码放base64字段,语言模型、排版解析等选项放options字段,完整参数表见 图片识别接口文档,以官方文档为准。文档识别也有对应的上传、查询、下载接口,详见 HTTP 接口手册。
怎么算成了:命令行跑完,文本出现在剪贴板或你指定的文件里;浏览器访问get_options能看到 JSON 参数定义。没反应的话,九成是 HTTP 服务没开,回"全局设置"查一下。
别栽在这:命令行任务沿用"截图 OCR"标签页的参数设定。不希望任务时弹出主窗口,就在该标签页里关掉对应选项。
参数速查:真正要动的就这几个
| 参数 | 默认 | 建议 | 为什么 |
|---|---|---|---|
| 排版解析 | 多栏-按自然段换行 | 代码选"单栏-保留缩进",文档保持默认 | 引擎只管认字,缩进和阅读顺序全靠它 |
| 限制图像边长 | 960 | 2880或4320 | 默认960会先压缩大图,小字容易糊 |
| 语言/模型库 | 简体中文 | 纯英文、纯代码换models/config_en.txt | 中文模型认纯英文容易出怪字符 |
| OCR 引擎插件 | Rapid-OCR(自带) | 保持默认,不够用再在全局设置切换 | 自带的兼容性好、够快,省去折腾 |
界面改动会自动存进UmiOCR-data/.settings(ini 格式),也允许手动修改,改完执行umi-ocr --reload重新加载即可。
识别结果不对时怎么办
| 现象 | 原因 | 处理 |
|---|---|---|
| 识别顺序错乱、读不通 | 默认排版解析不适合该图片的排版 | 换排版解析方案,代码选"单栏-保留缩进" |
| 大图里的小字认错 | 默认边长限制960先压缩了图片 | "限制图像边长"调到2880以上 |
| 水印、LOGO 文字混进结果 | 水印里的文本块被一起识别 | 批量页画忽略区域,把水印整块框住 |
| 命令行 / HTTP 没反应 | HTTP 服务没开 | 全局设置里允许 HTTP 服务,主机选"仅本地" |
文档与源码入口
Umi-OCR 像个放在本地的 OCR 工具箱:截图、批量、PDF 一次做完,还留了命令行和 HTTP 两个口子接自动化。想深入的话,docs/README_CLI.md 和 docs/http/README.md 是完整参考,Python 源码在UmiOCR-data/py_src/目录里,欢迎直接翻。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考