Umi-OCR 完整指南:截图、批量图片与扫描 PDF 的免费离线 OCR
2026/9/5 17:54:44 网站建设 项目流程

Umi-OCR 完整指南:截图、批量图片与扫描 PDF 的免费离线 OCR

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、完全离线的 OCR 软件,识别过程全部在本地引擎中完成。它覆盖屏幕截图文字识别、批量图片识别、扫描版 PDF 提取,以及二维码的扫码与生成,解压后就能用,不需要联网、也不涉及任何安装。

项目定位:Umi-OCR 是什么

一句话概括:它是一个跑在你自己电脑里的文字识别工具箱,图片不会流向任何外部服务器,扫描件和内部文档可以放心处理,断网状态下功能也照常可用。

核心能力一览:

功能说明
截图 OCR快捷键唤起截屏,框选即识别,结果可编辑、可划选复制
批量 OCR一次导入几百张图片,无数量上限,支持导出 txt / jsonl / md / csv
文档识别解析 PDF、xps、epub、mobi、fb2、cbz,可输出双层可搜索 PDF
二维码截图、粘贴或拖入图片读取条码,也支持输入文本生成二维码图
外部调用提供命令行与 HTTP 接口,方便脚本和其他程序接入

软件适配 Windows 7 x64 与 Linux x64,首次启动时会跟随系统自动选择界面语言。

安装与首次运行:解压即用

  1. 获取发布包:使用仓库根目录下的Umi-OCR_Rapid_v2.1.5.7z,没有解压缩软件的机器可以改用配套的.7z.exe自解压包;也可以自行克隆代码git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR构建。
  2. 把压缩包释放到任意目录,整个软件没有安装环节,也不挑路径。
  3. 运行Umi-OCR.exe(Linux 下为umi-ocr.sh)打开主程序。
  4. 切到「截图OCR」标签页,点左侧工具栏的截屏图标,在屏幕上拖出一个矩形框。
  5. 松开鼠标,识别出的文字就落在右侧「记录」面板,随时可以划选复制。

界面左侧是被截取的代码图片预览,下方有「隐藏文本」开关和缩放比例;右侧「记录」页签列出识别文字,右上角是「滚动」开关与「清空」按钮。

实战场景:从一张截图到一整批文件

截图识别网页文字

适合网页正文、聊天截图、屏幕中的代码这类零散需求。进入「截图OCR」页后点截屏图标,拖框选定区域即可;也可以在别处复制一张图片,直接粘贴进来识别。左侧预览栏支持鼠标划选,右侧「记录」栏允许编辑文字、跨多条记录划选后一次性复制,右键还有「复制(Ctrl+C)」「全选(Ctrl+A)」「复制图片」等快捷入口。

图中左侧是带选区的文档截图,右键菜单列出复制、全选、复制图片、显示/隐藏文字等选项;右侧「记录」面板按时间排列每次识别的结果。

批量导入图片文件夹

几十张图不想一张张开?「批量OCR」页点「选择图片」,文件或整个文件夹都能加入队列,支持jpg、png、webp、bmp、tif等常见格式,且没有数量上限。右侧设置区确认语言、排版解析等参数后点「开始任务」,顶部进度条会实时给出耗时、完成数与百分比,「记录」面板逐张展示识别文本并附带置信度。长图或超大图若识别精度不理想,可在设置里调高「限制图像边长」的数值;任务结束后还能自动关机或待机。

左侧列表已排入 13 张图片,进度条显示「1.4s 3/13 23%」,「开始任务」按钮就在旁边;右栏「记录」按文件名分组列出文字,每条标注时间与置信度。

扫描版 PDF 数字化

「文档识别」页面向扫描件工作:按页解析文档,先做 OCR,再把文字整理成可保存的纯文本,或者生成「双层 PDF」——原扫描画面保持不动,上面叠加一层可搜索、可复制的文字,版式观感完全不变。它同样支持设置忽略区域来剔除页眉页脚,多个文档可一次加入,识别参数与批量图片页共用一套配置,不用重复调。

提升准确率:排版解析与三个调优点

排版解析方案决定引擎找到文字块之后怎么排序换行,选错方案会让输出顺序混乱:

方案适合什么内容
多栏-按自然段换行报纸、网页等多栏文档,默认选择
单栏-保留缩进代码截图、缩进文本,行首空格原样保留
多栏-无换行表格与密集排版,输出连续文本
单栏-总是换行每行都是独立短句的场景
不做处理直接采用引擎原始输出

排除干扰:在「忽略区域」编辑器里按住右键画矩形框,把水印、LOGO、页眉页脚包住,任务执行时位于框内的整个文本块会被直接舍弃,框尽量画大一些,盖住水印可能出现的全部位置。

「记录」面板每条结果上方都标着耗时和置信度(如 0.92),数值明显偏低时换更清晰的源图,或在设置里把「限制图像边长」从默认 960 调高,精度通常会有改善;对记录右键可以删除单条或清空全部。

方向纠偏:遇到倾斜、倒置的文字,打开「文本方向纠偏」,引擎会先判断方向再识别,准确率提升,速度会略降。

进阶调用:命令行与 HTTP 接口

主程序本身就是命令行入口。前提是「全局设置」页里保持允许 HTTP 服务(默认开启,主机选「仅本地」即可),因为指令是通过系统内部环回传给后台进程的,不走物理网卡。

umi-ocr --screenshot --clip umi-ocr --path "D:/notes/img1.png" --output text.txt umi-ocr --help

第一条发起截屏识别并把结果送进剪贴板,第二条识别指定文件(也接受文件夹、多路径),写结果到text.txt;指令还支持简写,如--screenshot可缩成--sc。完整参数见 命令行手册。

程序化接入则走 HTTP 接口:服务默认监听 1224 端口,图片识别调用 POST/api/ocr,请求体传图片的base64字符串与可选的options参数字典,把data.format设为text就只拿识别文本;GET/api/ocr/get_options能查询当前引擎支持的全部参数及默认值。二维码识别/生成、PDF 文档识别也各有对应接口,详见 HTTP 接口文档。

「全局设置」页的服务区控制 HTTP 开关与监听地址,保持「仅本地」时只有本机能发起请求。

常见问题

识别时必须联网吗?不需要。识别由内置离线引擎完成,断网环境一样工作;HTTP 服务也只在本机环回上通信,默认主机就是「仅本地」。

识别语言在哪里切换?「截图OCR」「批量OCR」右侧设置里可以切换简体、繁体、英文、日文、韩文等模型库,混合语言的文档按文字主体选一套即可。

倾斜或倒着的文字认得出来吗?可以。开启「文本方向纠偏」后引擎先判方向再识别,代价是速度略有下降。

结果存在哪、怎么带走?默认展示在右侧「记录」面板,直接复制或导出即可;批量任务可导出txt、jsonl、md、csv四种格式;命令行调用还能用--output把结果直接写进文本文件。

从一张随手截图到一整批扫描件,日常遇到的文字提取活计基本都被 Umi-OCR 收进了一个窗口里,而且它自始至终不碰外网 🎉

相关资源:

  • CHANGE_LOG.md:历次版本更新记录
  • docs/README_CLI.md:命令行完整手册,含范围截屏与高级指令
  • docs/http/README.md 与 docs/http/api_ocr.md:HTTP 接口总览及参数细节
  • Umi-OCR_Rapid_v2.1.5.7z:仓库根目录的发布包,解压即可运行

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询