视频加载失败

【OCR工具推荐其一】Umi-OCR:图片文字识别,截图、批量、PDF全搞定

2474 字
12 分钟
【OCR工具推荐其一】Umi-OCR:图片文字识别,截图、批量、PDF全搞定
【OCR工具推荐其一】Umi-OCR:图片文字识别,截图、批量、PDF全搞定

朋友们!遇到图片里的文字想复制?#

你是不是经常遇到这些困扰:

  • 图片文字无法复制:看到截图里的重要文字,却无法直接复制
  • 在线OCR不安全:上传敏感图片到第三方网站,担心数据泄露
  • 批量处理太麻烦:需要识别几十张图片,一张一张处理太累
  • PDF扫描件无法搜索:扫描版PDF无法检索内容,翻页找信息太耗时
  • 公式无法提取:文档里的数学公式,想复制出来却无能为力
  • 需要网络才能用:离线环境下无法使用OCR工具

今天我要给大家分享一个 GitHub 上的宝藏项目——Umi-OCR!这是一款完全免费开源的离线OCR软件,支持截图识别、批量OCR、PDF识别、二维码、公式识别,解压即用,无需网络!

✨ 什么是 Umi-OCR?#

Umi-OCR 是一款免费、开源、可批量的离线OCR软件,适用于 Windows7 x64 和 Linux x64。它内置高效率的离线OCR引擎,支持多种语言识别,无需网络即可运行。

核心特点

  • 🆓 完全免费:所有代码开源,无任何隐藏费用
  • 🔌 离线运行:无需网络,所有识别在本地完成
  • 📦 解压即用:无需安装,解压后即可使用
  • 🚀 高效识别:内置多种OCR引擎,识别速度快、准确率高
  • ✂️ 截图OCR:快捷键唤起截图,一键识别图片中的文字
  • 📷 批量OCR:支持批量导入图片,一次性识别几百张
  • 📄 PDF识别:从PDF扫描件中提取文本,生成可搜索PDF
  • 📐 公式识别:支持数学公式识别
  • 📱 二维码:支持扫码和生成二维码
  • 🖥️ 命令行调用:支持脚本自动化处理
  • 🌐 HTTP接口:支持外部程序调用

🎯 核心功能#

1. 截图OCR#

截图OCR是Umi-OCR最常用的功能,只需按下快捷键即可唤起截图,识别图中的文字:

- 快捷键唤起截图(默认Ctrl+Shift+A)
- 左侧图片预览栏,可直接划选复制
- 右侧识别记录栏,可编辑文字,支持多选复制
- 支持粘贴图片进行识别
- 支持公式识别

文本后处理:支持多种排版解析方案,自动识别多栏布局,按正确顺序输出文字:

  • 多栏-按自然段换行
  • 多栏-总是换行
  • 多栏-无换行
  • 单栏-按自然段换行
  • 单栏-保留缩进(适合代码截图)
  • 不做处理

2. 批量OCR#

批量OCR功能可以一次性导入大量图片进行识别:

- 支持格式:jpg, jpeg, png, webp, bmp, tif等
- 输出格式:txt, jsonl, md, csv(Excel)
- 支持文本后处理,整理排版和顺序
- 无数量上限,可一次性导入几百张
- 支持任务完成后自动关机/待机
- 支持处理超大长图

忽略区域:可以排除图片中不想要的文字,比如水印、LOGO等:

  • 在批量识别页右栏设置中进入忽略区域编辑器
  • 按住右键绘制矩形框,框内的文字将被忽略
  • 适合处理带有水印的批量图片

3. 文档识别#

文档识别功能可以处理PDF等文档格式:

- 支持格式:pdf, xps, epub, mobi, fb2, cbz
- 对扫描件进行OCR,提取原有文本
- 可输出为双层可搜索PDF
- 支持设定忽略区域,排除页眉页脚
- 支持任务完成后自动关机/休眠

4. 二维码#

二维码功能支持扫码和生成:

扫码:
- 截图/粘贴/拖入图片,读取二维码、条形码
- 支持一图多码
- 支持19种协议(QRCode、DataMatrix、PDF417等)
生成码:
- 输入文本,生成二维码图片
- 支持19种协议和纠错等级

5. 全局设置#

全局设置可以调整软件的各种参数:

- 一键添加快捷方式或设置开机自启
- 更改界面语言(支持繁中、英语、日语等)
- 切换界面主题(多个亮/暗主题)
- 调整界面文字大小和字体
- 切换OCR插件
- 调整渲染器(解决截屏闪烁、UI错位问题)

🚀 安装方式#

方式一:下载压缩包(推荐)#

  1. 访问 GitHub 发布页面:https://github.com/hiroi-sora/Umi-OCR/releases/latest
  2. 下载 .7z 压缩包或 .7z.exe 自解压包
  3. 解压后点击 Umi-OCR.exe 即可启动

国内下载地址(蓝奏云,免注册/无限速): https://hiroi-sora.lanzoul.com/s/umi-ocr

方式二:Scoop 安装(Windows)#

Terminal window
# 添加 extras 桶
scoop bucket add extras
# 安装 Umi-OCR(Rapid-OCR引擎,兼容性好)
scoop install extras/umi-ocr
# 或安装 Paddle-OCR 引擎版本(速度稍快)
scoop install extras/umi-ocr-paddle

方式三:Linux 安装#

Terminal window
# 下载压缩包
wget https://github.com/hiroi-sora/Umi-OCR/releases/latest/download/Umi-OCR-linux-x64.7z
# 解压
7z x Umi-OCR-linux-x64.7z
# 运行
./Umi-OCR/umi-ocr.sh

📝 使用场景#

场景一:截图识别文字#

操作步骤:
1. 按下 Ctrl+Shift+A 唤起截图
2. 框选需要识别的区域
3. 识别结果自动显示在右侧
4. 复制识别结果即可
适用场景:
- 复制网页上无法选中的文字
- 识别PDF中的文字
- 提取截图中的关键信息

场景二:批量处理图片#

操作步骤:
1. 切换到"批量OCR"标签页
2. 导入需要识别的图片
3. 设置忽略区域(如有水印)
4. 选择输出格式
5. 点击开始识别
适用场景:
- 处理大量扫描件
- 识别图片库中的文字
- 批量提取截图内容

场景三:PDF识别#

操作步骤:
1. 切换到"文档识别"标签页
2. 导入PDF文件
3. 设置输出格式(txt或双层PDF)
4. 点击开始识别
适用场景:
- 将扫描版PDF转为可搜索PDF
- 提取PDF中的文字内容
- 批量处理PDF文档

场景四:二维码处理#

扫码:
1. 切换到"二维码"标签页
2. 粘贴或拖入包含二维码的图片
3. 自动识别并显示结果
生成码:
1. 切换到"二维码"标签页
2. 输入要生成的文本
3. 选择协议和纠错等级
4. 生成二维码图片
适用场景:
- 识别商品包装上的二维码
- 生成分享链接二维码
- 批量生成二维码

场景五:命令行调用#

Terminal window
# 截图识别
Umi-OCR.exe --clipboard
# 识别单张图片
Umi-OCR.exe --img "C:\test.png" --out "C:\result.txt"
# 批量识别
Umi-OCR.exe --img "C:\images" --out "C:\result" --format md
# 识别PDF
Umi-OCR.exe --pdf "C:\test.pdf" --out "C:\result.txt"
# 二维码识别
Umi-OCR.exe --qr "C:\qrcode.png"

🌐 HTTP接口调用#

除了命令行,Umi-OCR还支持HTTP接口调用,方便开发者集成到自己的应用中。

启用HTTP服务#

在全局设置页中勾选高级,确保HTTP服务已开启(默认开启)。如果需要允许局域网访问,请将主机切换到任何可用地址

API调用示例#

图片OCR识别(Base64方式)

Terminal window
curl -X POST http://localhost:10101/api/ocr \
-H "Content-Type: application/json" \
-d '{"image": "base64编码的图片数据"}'

二维码识别

Terminal window
curl -X POST http://localhost:10101/api/qrcode \
-H "Content-Type: application/json" \
-d '{"image": "base64编码的图片数据"}'

PDF文档识别

Terminal window
curl -X POST http://localhost:10101/api/doc \
-H "Content-Type: application/json" \
-d '{"files": ["base64编码的PDF数据"], "outputFormat": "txt"}'

获取OCR参数

Terminal window
curl http://localhost:10101/api/ocr/get_options

注意事项#

  • 关闭软件时,如果仍有用户未断开HTTP连接,可能导致关闭不完全,需进任务管理器强制结束进程
  • 并发支持较差,尽量不要并发调用
  • 长时间大批量连续调用时,可能出现连接拒绝报错,重新发起请求即可

📊 对比其他方案#

方案离线免费批量处理PDF识别二维码公式识别命令行
Umi-OCR
在线OCR工具✅/付费
天若OCR
白描付费
Adobe Acrobat付费

📜 开源协议#

Umi-OCR 采用 Apache-2.0 开源协议,完全免费使用。

📝 总结#

Umi-OCR 是一款功能强大的免费离线OCR软件,特别适合需要处理大量图片文字、PDF扫描件的用户。它支持截图识别、批量OCR、PDF识别、二维码、公式识别等多种功能,所有处理都在本地完成,无需网络,数据安全有保障。无论是学生、上班族还是开发者,都能从中受益。如果你经常需要识别图片中的文字,这个工具绝对值得一试!

🌟 项目资源#

GitHub 地址: https://github.com/hiroi-sora/Umi-OCR

发布页面: https://github.com/hiroi-sora/Umi-OCR/releases/latest

国内下载: https://hiroi-sora.lanzoul.com/s/umi-ocr

插件库: https://github.com/hiroi-sora/Umi-OCR_plugins

命令行手册: https://github.com/hiroi-sora/Umi-OCR/blob/main/docs/README_CLI.md

HTTP接口手册: https://github.com/hiroi-sora/Umi-OCR/blob/main/docs/http/README.md

觉得项目不错的话,记得给作者点个 star 支持一下!

🎉 互动时间#

你最常用的OCR功能是什么?在使用过程中遇到过什么问题?欢迎在评论区和我交流分享!

我会定期分享更多好用的工具,记得关注我哦!


推荐阅读:

如果您觉得这篇文章有帮助,请为小王点点推荐,谢谢!🌹

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!

打赏
【OCR工具推荐其一】Umi-OCR:图片文字识别,截图、批量、PDF全搞定
https://blog.huhaha.vip/posts/tools/实用工具/umi-ocr-intro/
作者
小王的博客
发布于
2026-06-25
许可协议
CC BY-NC-SA 4.0
相关文章智能推荐
1
【OCR工具推荐其二】Pot:翻译+OCR二合一神器,划词翻译、截图识别全覆盖
工具推荐一款支持翻译和OCR二合一的开源桌面工具,截图OCR识别、划词翻译、截图翻译多功能集于一身。支持多语言识别、离线OCR引擎、多翻译接口、语音合成和生词本导出,Windows/Mac/Linux全平台免费使用,插件丰富可扩展!
2
离线OCR神器!这个工具让图片文字轻松提取
docker支持多语言,精准识别,完全本地化,保护隐私
3
喜欢的博主突然下架视频?这个开源工具,一键备份所有精彩内容!
工具推荐一款完全免费开源的抖音视频下载工具,支持单个视频、图片笔记、合集、音乐、收藏、用户主页批量下载,无水印优先,最高质量选择,还支持直播录制和评论采集。支持CLI命令行和REST API,适合备份喜欢的博主内容!
4
做自媒体的看过来!这个工具一键完成视频翻译、字幕生成、AI配音
工具推荐一款完全免费开源的AI视频翻译工具,支持语音识别、字幕翻译、多角色配音、语音克隆全流程。支持30+在线API和本地模型(Faster-Whisper、Ollama等),Windows一键运行,Linux/macOS源码部署,适合自媒体创作者和视频翻译工作者!
5
GitHub热门项目!OmniRoute:一个端点连接237个AI服务商,每月16亿免费Token!
工具推荐一款开源AI网关项目,一个端点连接237个AI服务商(90+免费),支持自动故障转移、RTK+Caveman压缩节省15-95%Token、每月约16亿免费Token,兼容Claude Code、Cursor、Copilot等所有编码工具!
随机文章随机推荐

评论区

Profile Image of the Author
小王的博客
一个上了年纪的猿人.
分类
标签
最新动态
站点统计
文章
209
分类
15
标签
161
总字数
478,322
运行时长
0
最后活动
0 天前
站点信息
构建平台
Vercel
博客版本
Firefly v6.16.7
文章许可
CC BY-NC-SA 4.0
文章目录