【OCR工具推荐其一】Umi-OCR:图片文字识别,截图、批量、PDF全搞定

朋友们!遇到图片里的文字想复制?
你是不是经常遇到这些困扰:
- 图片文字无法复制:看到截图里的重要文字,却无法直接复制
- 在线OCR不安全:上传敏感图片到第三方网站,担心数据泄露
- 批量处理太麻烦:需要识别几十张图片,一张一张处理太累
- PDF扫描件无法搜索:扫描版PDF无法检索内容,翻页找信息太耗时
- 公式无法提取:文档里的数学公式,想复制出来却无能为力
- 需要网络才能用:离线环境下无法使用OCR工具
今天我要给大家分享一个 GitHub 上的宝藏项目——Umi-OCR!这是一款完全免费开源的离线OCR软件,支持截图识别、批量OCR、PDF识别、二维码、公式识别,解压即用,无需网络!
✨ 什么是 Umi-OCR?
Umi-OCR 是一款免费、开源、可批量的离线OCR软件,适用于 Windows7 x64 和 Linux x64。它内置高效率的离线OCR引擎,支持多种语言识别,无需网络即可运行。
核心特点:
- 🆓 完全免费:所有代码开源,无任何隐藏费用
- 🔌 离线运行:无需网络,所有识别在本地完成
- 📦 解压即用:无需安装,解压后即可使用
- 🚀 高效识别:内置多种OCR引擎,识别速度快、准确率高
- ✂️ 截图OCR:快捷键唤起截图,一键识别图片中的文字
- 📷 批量OCR:支持批量导入图片,一次性识别几百张
- 📄 PDF识别:从PDF扫描件中提取文本,生成可搜索PDF
- 📐 公式识别:支持数学公式识别
- 📱 二维码:支持扫码和生成二维码
- 🖥️ 命令行调用:支持脚本自动化处理
- 🌐 HTTP接口:支持外部程序调用

🎯 核心功能
1. 截图OCR
截图OCR是Umi-OCR最常用的功能,只需按下快捷键即可唤起截图,识别图中的文字:
- 快捷键唤起截图(默认Ctrl+Shift+A)- 左侧图片预览栏,可直接划选复制- 右侧识别记录栏,可编辑文字,支持多选复制- 支持粘贴图片进行识别- 支持公式识别
文本后处理:支持多种排版解析方案,自动识别多栏布局,按正确顺序输出文字:
- 多栏-按自然段换行
- 多栏-总是换行
- 多栏-无换行
- 单栏-按自然段换行
- 单栏-保留缩进(适合代码截图)
- 不做处理

2. 批量OCR
批量OCR功能可以一次性导入大量图片进行识别:
- 支持格式:jpg, jpeg, png, webp, bmp, tif等- 输出格式:txt, jsonl, md, csv(Excel)- 支持文本后处理,整理排版和顺序- 无数量上限,可一次性导入几百张- 支持任务完成后自动关机/待机- 支持处理超大长图
忽略区域:可以排除图片中不想要的文字,比如水印、LOGO等:
- 在批量识别页右栏设置中进入忽略区域编辑器
- 按住右键绘制矩形框,框内的文字将被忽略
- 适合处理带有水印的批量图片
3. 文档识别
文档识别功能可以处理PDF等文档格式:
- 支持格式:pdf, xps, epub, mobi, fb2, cbz- 对扫描件进行OCR,提取原有文本- 可输出为双层可搜索PDF- 支持设定忽略区域,排除页眉页脚- 支持任务完成后自动关机/休眠
4. 二维码
二维码功能支持扫码和生成:
扫码:- 截图/粘贴/拖入图片,读取二维码、条形码- 支持一图多码- 支持19种协议(QRCode、DataMatrix、PDF417等)
生成码:- 输入文本,生成二维码图片- 支持19种协议和纠错等级
5. 全局设置
全局设置可以调整软件的各种参数:
- 一键添加快捷方式或设置开机自启- 更改界面语言(支持繁中、英语、日语等)- 切换界面主题(多个亮/暗主题)- 调整界面文字大小和字体- 切换OCR插件- 调整渲染器(解决截屏闪烁、UI错位问题)
🚀 安装方式
方式一:下载压缩包(推荐)
- 访问 GitHub 发布页面:https://github.com/hiroi-sora/Umi-OCR/releases/latest
- 下载
.7z压缩包或.7z.exe自解压包 - 解压后点击
Umi-OCR.exe即可启动
国内下载地址(蓝奏云,免注册/无限速): https://hiroi-sora.lanzoul.com/s/umi-ocr
方式二:Scoop 安装(Windows)
# 添加 extras 桶scoop bucket add extras
# 安装 Umi-OCR(Rapid-OCR引擎,兼容性好)scoop install extras/umi-ocr
# 或安装 Paddle-OCR 引擎版本(速度稍快)scoop install extras/umi-ocr-paddle方式三:Linux 安装
# 下载压缩包wget https://github.com/hiroi-sora/Umi-OCR/releases/latest/download/Umi-OCR-linux-x64.7z
# 解压7z x Umi-OCR-linux-x64.7z
# 运行./Umi-OCR/umi-ocr.sh📝 使用场景
场景一:截图识别文字
操作步骤:1. 按下 Ctrl+Shift+A 唤起截图2. 框选需要识别的区域3. 识别结果自动显示在右侧4. 复制识别结果即可
适用场景:- 复制网页上无法选中的文字- 识别PDF中的文字- 提取截图中的关键信息场景二:批量处理图片
操作步骤:1. 切换到"批量OCR"标签页2. 导入需要识别的图片3. 设置忽略区域(如有水印)4. 选择输出格式5. 点击开始识别
适用场景:- 处理大量扫描件- 识别图片库中的文字- 批量提取截图内容场景三:PDF识别
操作步骤:1. 切换到"文档识别"标签页2. 导入PDF文件3. 设置输出格式(txt或双层PDF)4. 点击开始识别
适用场景:- 将扫描版PDF转为可搜索PDF- 提取PDF中的文字内容- 批量处理PDF文档场景四:二维码处理
扫码:1. 切换到"二维码"标签页2. 粘贴或拖入包含二维码的图片3. 自动识别并显示结果
生成码:1. 切换到"二维码"标签页2. 输入要生成的文本3. 选择协议和纠错等级4. 生成二维码图片
适用场景:- 识别商品包装上的二维码- 生成分享链接二维码- 批量生成二维码场景五:命令行调用
# 截图识别Umi-OCR.exe --clipboard
# 识别单张图片Umi-OCR.exe --img "C:\test.png" --out "C:\result.txt"
# 批量识别Umi-OCR.exe --img "C:\images" --out "C:\result" --format md
# 识别PDFUmi-OCR.exe --pdf "C:\test.pdf" --out "C:\result.txt"
# 二维码识别Umi-OCR.exe --qr "C:\qrcode.png"🌐 HTTP接口调用
除了命令行,Umi-OCR还支持HTTP接口调用,方便开发者集成到自己的应用中。
启用HTTP服务
在全局设置页中勾选高级,确保HTTP服务已开启(默认开启)。如果需要允许局域网访问,请将主机切换到任何可用地址。

API调用示例
图片OCR识别(Base64方式):
curl -X POST http://localhost:10101/api/ocr \ -H "Content-Type: application/json" \ -d '{"image": "base64编码的图片数据"}'二维码识别:
curl -X POST http://localhost:10101/api/qrcode \ -H "Content-Type: application/json" \ -d '{"image": "base64编码的图片数据"}'PDF文档识别:
curl -X POST http://localhost:10101/api/doc \ -H "Content-Type: application/json" \ -d '{"files": ["base64编码的PDF数据"], "outputFormat": "txt"}'获取OCR参数:
curl http://localhost:10101/api/ocr/get_options注意事项
- 关闭软件时,如果仍有用户未断开HTTP连接,可能导致关闭不完全,需进任务管理器强制结束进程
- 并发支持较差,尽量不要并发调用
- 长时间大批量连续调用时,可能出现连接拒绝报错,重新发起请求即可
📊 对比其他方案
| 方案 | 离线 | 免费 | 批量处理 | PDF识别 | 二维码 | 公式识别 | 命令行 |
|---|---|---|---|---|---|---|---|
| Umi-OCR | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 在线OCR工具 | ❌ | ✅/付费 | ❌ | ✅ | ❌ | ❌ | ❌ |
| 天若OCR | ✅ | ✅ | ❌ | ❌ | ❌ | ❌ | ❌ |
| 白描 | ❌ | 付费 | ✅ | ✅ | ✅ | ❌ | ❌ |
| Adobe Acrobat | ✅ | 付费 | ✅ | ✅ | ❌ | ✅ | ❌ |
📜 开源协议
Umi-OCR 采用 Apache-2.0 开源协议,完全免费使用。
📝 总结
Umi-OCR 是一款功能强大的免费离线OCR软件,特别适合需要处理大量图片文字、PDF扫描件的用户。它支持截图识别、批量OCR、PDF识别、二维码、公式识别等多种功能,所有处理都在本地完成,无需网络,数据安全有保障。无论是学生、上班族还是开发者,都能从中受益。如果你经常需要识别图片中的文字,这个工具绝对值得一试!
🌟 项目资源
GitHub 地址: https://github.com/hiroi-sora/Umi-OCR
发布页面: https://github.com/hiroi-sora/Umi-OCR/releases/latest
国内下载: https://hiroi-sora.lanzoul.com/s/umi-ocr
插件库: https://github.com/hiroi-sora/Umi-OCR_plugins
命令行手册: https://github.com/hiroi-sora/Umi-OCR/blob/main/docs/README_CLI.md
HTTP接口手册: https://github.com/hiroi-sora/Umi-OCR/blob/main/docs/http/README.md
觉得项目不错的话,记得给作者点个 star 支持一下!
🎉 互动时间
你最常用的OCR功能是什么?在使用过程中遇到过什么问题?欢迎在评论区和我交流分享!
我会定期分享更多好用的工具,记得关注我哦!
推荐阅读:
- GitHub热门项目!yantr:自托管应用商店,不占用系统资源,130+应用一键部署
- GitHub热门项目!BentoPDF:浏览器端隐私优先的PDF工具箱,50+工具一键搞定
- GitHub热门项目!PakePlus:网页秒变桌面应用
- 服务器到期宕机?域名过期被抢注?这个工具帮你守住所有服务
- GitHub 热门项目!DBX,15MB 搞定 40+ 数据库管理!
- 从Hexo到Astro Firefly:我的博客迁移之旅
- 自建图床又一选择?这个工具让你打造个人图片分享平台!
- 离线OCR神器!这个工具让图片文字轻松提取
- 保姆级教程!用PicList+GitHub搭建免费图床,超详细配置指南!
- 文件分发利器!这个工具让文件分享更安全
- Docker打包工具!这个Electron工具让镜像管理更高效!
- Redis管理神器!这个工具让你的数据操作更高效
- 又一个 Rust 神级编辑器!Fresh 让我放弃了 VS Code
如果您觉得这篇文章有帮助,请为小王点点推荐,谢谢!🌹
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!
小王的博客














