Umi-OCR 免费离线OCR软件完整指南:截图、批量与PDF识别一次搞定
2026/9/11 10:13:58 网站建设 项目流程

Umi-OCR 免费离线OCR软件完整指南:截图、批量与PDF识别一次搞定

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款完全免费、开源、离线运行的OCR软件,截图、批量图片导入、PDF文档识别都能在本地完成,无需任何网络。它内置中文、英文、日文等多种语言识别库,支持 Windows 7 x64 与 Linux x64,解压即用,不需要安装依赖,适合财务、开发、档案管理等需要处理扫描件和截图的普通用户。

速览:这份指南适合谁

项目说明
许可证完全免费、代码开源
平台Windows 7 x64 / Linux x64
是否联网全程离线,无云端上传
安装方式下载压缩包解压即用,免安装
适合人群需要批量识别图片、扫描PDF、代码截图的办公与开发用户

三个具体的使用场景

  • 财务小周:每周要处理几十张发票扫描件,希望批量转成文字再录入表格。传统在线工具要求逐张上传,数据敏感、速度也不稳定;她要的是一台内网电脑上就能跑、不碰网络的离线OCR工具。
  • 后端开发老陈:内网环境连不上外部网站,只能对着屏幕上的代码截图手动敲。他想把截图里的代码块连同缩进一起识别出来,粘贴到本地仓库里改。
  • 档案管理员:手上有一批扫描版PDF,文字在图片里,搜索框永远搜不到内容。她需要把这些文件转成"可搜索PDF",同时保留原样外观供领导翻阅。

把一堆图片一次性识别成文字

打开"批量OCR"标签页,拖入本地图片即可开始。支持 jpg、png、bmp、webp、tif 等常见格式,没有数量上限,一次导入几百张也能跑完。识别结果可保存为 txt、jsonl、md、csv(可进 Excel)四种格式,方便直接进下一步流程。任务跑完还能设置自动关机或待机,晚上挂机处理大文件夹正合适。识别质量差的图片,可以先在页面设置里调整参数,或参考下面"避坑"里的边长限制技巧。

把扫描件变成可搜索的PDF

"文档识别"标签页支持 pdf、xps、epub、mobi、fb2、cbz 等格式。它做两件事:对已有文本层的文档直接提取文字;对纯图片扫描件做OCR,并输出双层可搜索PDF——底层保留原始画面,上层叠加透明文字,既能搜索又能保持版式。页眉页脚、水印这类干扰文字可以用忽略区域功能排除,多个文件可同时排队处理,同样支持任务结束后自动关机/休眠。

把屏幕上的代码截图直接变成可粘贴文本

"截图OCR"是日常最高频的入口:用快捷键唤起截图,划选范围,识别结果立刻显示在右侧记录栏,可以直接编辑、划选多条记录合并复制。也支持在别处复制图片后粘贴进来识别。它的关键能力是排版解析方案:默认"多栏-按自然段换行"适合普通文档;识别代码截图时切换"单栏-保留缩进",行首缩进和行内空格都会保留,贴回编辑器不用重新排版。

顺带解决二维码的识别和生成

"二维码"标签页把扫码和生成放在了一起:截图、粘贴或拖入图片即可读取其中的二维码、条形码,一张图里有多个码也能全部识别,支持 QRCode、Code128、EAN13、PDF417 等19种协议。反过来,输入文本就能生成二维码图片,可以指定纠错等级和图片尺寸。内网环境里没有在线生成器时,这个功能比较实用。

实测:从解压到拿到第一份识别结果

  1. 下载发布包(.7z 压缩包或 .7z.exe 自解压包),解压到任意目录;Windows 双击Umi-OCR.exe,Linux 运行umi-ocr.sh,无需安装。
  2. 打开"批量OCR"标签页,拖入两三张测试图片,点开始任务;识别完成后逐张查看结果,或一键导出为 txt。
  3. 打开"全局设置",把界面语言切到习惯的语种(首次启动会跟随系统自动选择),再顺手添加桌面快捷方式和开机自启。

进阶:命令行与HTTP接口接入自动化

不想每次打开界面的话,主程序本身就是命令行入口。注意全局设置里的HTTP服务需保持开启(默认开启、仅本地),命令行指令通过本地回环发给后台进程,不经过物理网卡:

umi-ocr --path "D:/scans" "-->" result.txt umi-ocr --clip
umi-ocr --qrcode_create "文本内容" "D:/qr.jpg"

完整的参数说明见 docs/README_CLI.md,HTTP接口的字段与示例见 docs/http/。HTTP接口支持图片OCR(Base64 传图)、文档识别、二维码识别/生成四类调用,另有参数查询接口可以先拉取当前可用配置再发起识别,适合写进脚本里做自动化流水线。

避坑与技巧

  • 识别超大长图前,先调高边长限制:在页面设置 → 文字识别里把"限制图像边长"数值调大,否则超宽/超长图会被强制缩放,小字直接丢失。
  • 忽略区域的框要画大:按住右键绘制矩形时,完全包住水印可能出现的所有位置。机制上只忽略"整块"落在框内的文本,框画小了水印照样漏进结果。
  • 命令行没反应,先查HTTP服务:全局设置中必须允许HTTP服务,指令才能送达后台进程;主机保持"仅本地"即可。
  • 自动化脚本别高并发:官方文档明确说明底层引擎对并发支持较差,长时间批量连续调用可能间歇性报连接错误,顺序执行、失败重试更稳。
  • 老机器出现截图闪烁或UI错位:在"界面和外观 → 渲染器"里切换渲染方案或关闭硬件加速即可。

新手常见问题

Linux 能用吗?可以。发行版支持 Linux x64,解压后运行umi-ocr.sh启动,功能与 Windows 版一致。

需要装 Python 环境或联网吗?都不需要。Windows 版已内置 Python 环境、运行库和OCR引擎,全部识别过程在本地完成,断网也能跑。

界面是中文,但我需要英文文档说明?全局设置 → 语言/Language 可切换英文、日文、繁中等语种,翻译协作还在持续补充新语言。

写在最后

Umi-OCR 给出的是一套完整路径:截图OCR处理屏幕内容,批量OCR消化图片文件夹,文档识别把扫描件变成可搜索PDF,二维码功能顺带解决扫码与生成,命令行和HTTP接口留给自动化需求。全程免费、离线、开源,隐私敏感的场景可以放心使用。下一步:去项目的 releases 页下载对应平台的发行包,解压后花十分钟跑完上面"实测"的三步,你就能拿到第一份识别结果了。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询