Linux 离线 OCR 指南:Umi-OCR 桌面入口、批量识别与二维码实战
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源免费的离线文字识别工具,截图 OCR、批量 OCR、PDF 文档识别、二维码扫描与生成都在本地完成,全程不经过网络。对处理内部文档、合同扫描件、代码截图等不宜上传云端的内容,或者干脆不想依赖在线服务的用户来说,这是一套完整的 Linux 桌面 OCR 工具链。
🚀 安装、启动与桌面入口配置
从官方发布渠道拿到 Linux 版.7z发行包,解压到固定目录,比如/opt/Umi-OCR,目录里有一个umi-ocr.sh启动脚本,赋予执行权限后直接运行即可,无需安装编译。
想让软件常驻应用菜单,再补一份桌面入口配置:把下面内容存到~/.local/share/applications/umi-ocr.desktop,之后在启动器里搜 "Umi-OCR" 就能启动。
[Desktop Entry] Type=Application Name=Umi-OCR Comment=开源离线 OCR 文字识别工具 Exec=/opt/Umi-OCR/umi-ocr.sh Terminal=false Categories=Utility;Office;Graphics;首次启动时,界面语言会跟随系统自动选择;不顺手的话,进"全局设置"在"语言/Language"下拉框改即可,主题、字号也能一并调整。
📸 截图 OCR:框选屏幕直接出文字
打开"截图OCR"标签页,用快捷键框选屏幕区域,识别结果实时出现在右侧记录栏。左侧图片预览上可以直接拖拽划选文字,记录条目也能跨条划选批量复制。文本后处理提供多栏/单栏、自然段换行等方案,多栏排版、竖排文字都能按阅读顺序输出,代码截图选"保留缩进"方案还能保住空格结构。
🗂 批量识别工作流
图片批量处理走"批量OCR"标签页:导入 jpg、png、webp、tiff 等常见格式,一次丢几百张也没有数量上限,结果可导出为 txt、jsonl、md、csv(Excel)四种格式。遇到超大长图处理慢,去页面设置把"限制图像边长"调高即可。整批图片带同一位置水印或页眉页脚时,打开"忽略区域"编辑器,按住右键画若干矩形把干扰文字框住,识别时整块排除。
🔍 二维码:识别与生成
"二维码"标签页两边都能用。扫码侧支持截图、粘贴或拖入本地图片,一张图里多个码也都能读出来;生成侧输入文本直接产出二维码图片,还可以指定纠错等级。
⚡ 效率进阶:命令行、别名与右键识别
桌面操作之外,Umi-OCR 暴露了命令行入口,常用指令包括umi-ocr --screenshot(截屏识别)、--path(指定图片或文件夹路径批量识别),输出可用--clip进剪贴板、--output写文件:
umi-ocr --path ~/Pictures/scan --output ~/ocr_out.txt在~/.bashrc或~/.zshrc里加别名,日常调用更短:
alias ocr="/opt/Umi-OCR/umi-ocr.sh" alias ocr-batch="ocr --path"文件管理器集成则基于前面的.desktop条目做 MIME 关联:在文件管理器中为图片类型注册"用 Umi-OCR 识别"的右键动作,选完文件后脚本调用--path即可,不同桌面环境的注册方式略有差异,思路一致。
🩹 识别慢、点不动、排版乱:症状速查
| 症状 | 排查动作 |
|---|---|
| 点桌面图标无反应 | 终端直接运行umi-ocr.sh看报错,检查脚本可执行权限与依赖库是否齐全 |
| 界面闪烁、UI 错位 | 全局设置 → 渲染器,切换渲染方案或关闭硬件加速 |
| 批量任务排队很慢 | 分批导入;"限制图像边长"调高以处理超大长图 |
| 结果顺序乱、换行怪 | 换文本后处理方案:多栏/单栏、自然段换行或保留缩进 |
所有界面参数都落在发行版目录内的UmiOCR-data/.settings文件里,换机迁移时整目录复制即可,语言、主题、忽略区域等设置原样保留。
Umi-OCR 把离线 OCR 的完整链路装进了桌面:单张截图秒出文本,整批扫描件本地跑完,敏感内容不出本机。命令行细节与 HTTP 接口用法,可以翻仓库里的 docs/README_CLI.md 和 docs/http/ 两篇手册。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考