Umi-OCR免费离线OCR:4个场景,文件不出本机
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费OCR工具,也是少数真正离线的离线OCR:识别全程在本机完成,文件不出机器,断网照常跑。它把屏幕取字、批量图片转文字、扫描PDF加文字层、二维码读写收进同一个窗口里。
为什么是它
- 离线安全:图片、文档都在本地过一遍内置模型,不经过任何服务器。给公司、诊所传文件有顾虑的人,用它最稳。
- 免安装:下载压缩包,解压即用,不写注册表、不装运行时。换电脑频繁的人,拷一份就能带走全部设置。
- 免费开源:不收费、无账号墙、不按字数计次,代码公开可查。想自己编译、改流程的开发者可以直接动源码。
5分钟跑起来 🏃
- 下载发行包:
.7z压缩包或.7z.exe自解压包。→ 看到压缩文件在本地落盘,自解压包连压缩软件都省了。 - 解压到任意目录。→ 看到
Umi-OCR.exe和一堆运行文件。 - 双击
Umi-OCR.exe启动;Linux 上跑umi-ocr.sh脚本。→ 主界面弹出,标签页一目了然。
首次打开时界面语言跟随系统。想换简中、繁中、英、日、俄、葡或深浅主题,进「全局设置」切一下就好。想自己构建,克隆仓库后按 README 说明操作。
论文里选不中的死文字 🖱️
PDF 阅读器里有些文字锁得死死的,右键选不中。
- 打开「截图OCR」标签页。
- 按页面里的快捷键在屏幕上框住那段话。
- 看右侧识别记录栏,选中结果直接复制。
结果不理想时:调高图片对比度或转灰度,中英混排就选混合语言,还可以换内置的另一套引擎再跑一遍。
一夹发票扫描件进表格 📥
几十张 jpg 发票躺在文件夹里,文字要进表格,手敲不现实。
- 打开「批量OCR」页,把整个文件夹拖进去。jpg、png、webp、bmp、tif 都能进,几百张照排。
- 水印 LOGO 固定在同一个位置?按住右键在图上画矩形框住它,框内文字块整块跳过。
- 勾选保存格式:txt、jsonl、md、csv 四选一,csv 可直接进 Excel。
- 看左侧列表,每张图的耗时和状态都列得清清楚楚。
跑得很慢时:把「限制图像边长」调高,任务拆成几批排队,比硬扛一张超长图快。大任务跑完,还能勾选自动关机。
扫描PDF变可搜索 🔍
300 页扫描教材里 Ctrl+F 一点就扑空——因为它本质是一摞图片。
- 打开「文档识别」标签页,把 PDF 拖进去。
- 有固定页眉页脚,先框进忽略区域再开跑。
- 任务完成,导出结果。
拿到的是一份双层可搜索PDF:原扫描图完整保留为图像层,版式、插图原样不动;OCR 把每页文字转成一层透明文本叠在图上。Ctrl+F 命中的是文字层,能定位到第几页,整段复制也没问题。PDF 之外,XPS、EPUB、MOBI、FB2、CBZ 也支持。
文字层由内置的 RapidOCR、PaddleOCR 两套离线模型生成,不联网。
不想开界面 ⌨️
命令行入口就是主程序本身。把整个文件夹识别进一个文件:
umi-ocr --path "D:/images" --output "D:/result.txt"程序化调用走本地 HTTP 接口:图片识别、文档识别、二维码读写都有对应端点,只监听本机环回,不经过物理网卡。参数细节看 命令行手册 和 HTTP接口手册。
上手前,先知道边界
- 识别率吃输入质量:艺术字、潦草手写有上限,调参数救不了。
- 大文件、超长图吃内存:4GB 以下内存的机器,减小单批数量或调低「限制图像边长」。
- HTTP 接口对并发不友好,脚本里串行调用。
- 语言包覆盖中英日韩法德等常用语言,小语种内容建议选混合语言包。
Umi-OCR 把截图取字、批量转文字、扫描PDF加文字层、二维码读写收进同一个免费离线的本地工具,文件从头到尾没离开过你的机器。更多细节看 README,有问题去项目社区提 Issue 就行。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考