Umi-OCR 免费离线 OCR 软件完整指南:从截图到批量识别 5 分钟上手
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源免费的离线 OCR 文字识别软件,解压即可运行,不联网也能把截图、图片、PDF 里的文字提取成可复制的文本。
适合你吗?
先说清楚它适合干什么:
- 屏幕上有字但复制不了:网页图片、聊天记录里的代码、视频字幕,框一下就能变成文本;
- 有一堆图片要转文字:几十张、几百张截图或扫描件,拖进去批量处理,结果导出成 txt、csv(Excel)、md、jsonl;
- 手里只有 PDF 扫描件:想在里面搜索、复制文字,它可以生成"双层可搜索 PDF"——也就是图片下面垫了一层真实文字,既能看图又能检索。
一个明确的局限:它的识别引擎全部跑在你本机,速度取决于你的 CPU,处理几百张高清大图会比云端接口慢一些;另外它目前支持 Windows 7 x64 和 Linux x64,Mac 暂不支持。
拿到第一个结果:3 分钟跑通第一次截图识别
- 从项目的发布渠道下载
.7z压缩包(仓库里也有 Umi-OCR_Rapid_v2.1.5.7z),解压,不需要安装; - 双击
Umi-OCR.exe启动(Linux 下运行umi-ocr.sh)。首次打开时,界面语言会跟随你的系统自动切换; - 打开"截图OCR"标签页,按下截图快捷键,用鼠标框选屏幕上的文字,松开鼠标,识别结果立刻出现在右侧记录栏,直接划选复制即可。
如果你刚才在别处复制过一张图片,也可以跳过框选,直接把图片粘贴进 Umi-OCR 进行识别。从按下快捷键到复制文字,整个过程通常不超过 10 秒。
真实场景演练
场景一:代码截图还原,缩进原样保留
- 目标:把一张代码截图变成可以直接运行的代码,不想逐字重敲。
- 操作:截图后,在文本后处理的"排版解析方案"里选单栏-保留缩进(这个模式会原样保留行首缩进和行中空格),然后复制结果。
- 得到什么:带缩进、空格的代码文本,粘贴进编辑器就能用。
场景二:一文件夹图片批量转文字
- 目标:把整个文件夹里的扫描件、照片一次性转成文本。
- 操作:在"批量OCR"标签页把图片全部拖进去,点"开始任务"。支持 jpg、png、webp、bmp、tif 等常见格式,没有数量上限。
- 得到什么:每张图片对应一条识别记录,可整体导出为 txt、jsonl、md 或 csv(Excel)。任务完成前软件会显示进度和每张的耗时;完成时还可以设置自动关机/待机,睡前挂上任务,第二天收结果。
场景三:PDF 扫描件变成可搜索文档
- 目标:把整本扫描版 PDF 变成能搜索、能复制的电子版。
- 操作:在"文档识别"标签页导入 pdf、epub、mobi 等文件,选择输出为双层可搜索 PDF。
- 得到什么:一个既能显示原页面图像、又能全文检索和复制文字的新 PDF,纸质资料直接变成电子档案。
三个让人眼前一亮的细节
- 忽略区域:图片角落有水印、页眉页脚时,在编辑器里用鼠标框出这些位置,识别时整个区域被跳过。它替我省的是——不用再事后一行行删水印混进结果的脏字符;
- 排版解析:多栏排版的页面直接识别,文字顺序容易跳来跳去。选"多栏-按自然段换行"方案,它会按阅读顺序自动重排,横排、竖排(从右到左)都能处理;
- 二维码二合一:既能扫码(截图、粘贴或拖入图片,一图多码),也能输文本生成二维码图片,还支持 19 种码制,省去另外装一个扫码工具。
想要更多:把识别能力接进你的工作流
界面操作之外,Umi-OCR 还留了两条自动化通道:
- 命令行模式:支持
--path、--output、--clip等参数,一行命令就能批量识别一个文件夹(含子文件夹)并写入文件,配合脚本或定时任务可以无人值守。示例:
umi-ocr --path "扫描件目录" --output "输出.txt"- HTTP 接口:让其他程序远程调用图片识别、文档识别、二维码生成等功能,默认只监听本地,改到局域网地址后即可部署到服务器使用。
完整的参数和接口说明分别整理在 docs/README_CLI.md 和 docs/http/README.md,进阶时直接翻这两份文档即可。
另外,全局设置里可以一键切换中、英、日、俄等十多种界面语言,多个亮/暗主题和字体大小也都能调。
常见坑
- 命令行没反应?命令行依赖软件内置的 HTTP 服务(默认开启)。在全局设置页确认服务处于开启状态,主机选"仅本地"即可;
- 截图时屏幕闪烁、界面错位?多半是渲染器兼容问题,到全局设置 → 界面和外观 →渲染器,换一个渲染方案或关闭硬件加速;
- 超大长图识别失败?到批量页面设置 → 文字识别 → "限制图像边长",把数值调高再跑一次。
跑通第一次截图识别后,挑几张开着水印的图片试试忽略区域,就能体会批量任务的省心了。遇到 bug 可以提 Issue 反馈;项目也长期欢迎译者参与界面多语言翻译,从 CHANGE_LOG.md 可以看到每个版本的更新细节。让 Umi-OCR 成为你桌面上随取随用的文字提取工具,就从今天的第一张截图开始吧。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考