电脑上的免费离线OCR神器:Umi-OCR 从截图识图到PDF转文字全攻略
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你是否有过这样的经历:网页上的一段文字明明能看到,却被防复制限制得死死的,只能对着屏幕一个字一个字地敲?论文的扫描版PDF要引用,却没法复制里面的内容?同事发来的截图里,代码缩进和排版都乱了套?面对这些"看得见、摸不着"的文字,绝大多数人的第一反应是打开在线识别网站——然后被上传速度、文件大小限制和隐私担忧反复折磨。
其实,你完全可以彻底绕开这些问题。Umi-OCR是一款免费、开源、完全离线的文字识别软件,支持 Windows 和 Linux,无需联网、无需登录,解压就能用。它内置了多国语言识别库,把截屏识别、批量图片转文字、PDF扫描件提取、二维码扫描与生成都装进了一个轻量级界面里。下文会带你从零上手,并挖掘几个容易忽略但非常好用的进阶玩法。
先看看它能帮你省多少事
单说"离线"这两个字,就值得多说几句:图片和文档全程在你自己的电脑上处理,不会上传到任何服务器,敏感材料(合同、身份证、内部资料)也能放心识别;没有网也能照常干活;而且终身免费,不存在按次计费或会员墙。
日常使用中,它最常见的三种形态是这样的:
- 截图即识别:按下快捷键框选屏幕区域,松手即出文字。
- 批量导入:几百张图片拖进来,一次性跑完,输出成多种格式。
- 文档识别:PDF 扫描件一键转成可复制、可搜索的双层文本。
三步完成第一次截图识别
整个上手过程可以压缩成三步,从下载到产出第一个识别结果,一般不会超过五分钟。
第一步:拿到软件包并解压。从项目仓库获取压缩包(注意下载体积较大是因为自带识别引擎和语言库),解压到任意路径。建议放在不含中文字符的纯英文路径下,避免个别环境下出现兼容问题。Umi-OCR 不需要安装,解压后双击Umi-OCR.exe即可启动;Linux 用户运行umi-ocr.sh脚本。
第二步:打开"截图OCR"标签页。默认的截图快捷键是 Ctrl+Shift+S(也可在热键设置里改成顺手的那组),按下后屏幕会出现取景框,用鼠标框住想提取的文字区域,松开即开始识别。
第三步:拿到结果并处理。识别文字会立刻出现在右侧记录栏中,支持划选复制、右键菜单复制图片或文字。左侧还有图片预览栏,可以直接用鼠标划选其中的文字再复制。如果觉得一次截不准,右键还能"重复上一次截图"。
三类人群的专属玩法
同一个软件,不同人用出来的效果差别很大。下面按人群拆解最实用的组合拳。
办公族:批量处理与PDF文档提取
办公室里最多的麻烦是扫描件和纸质材料。Umi-OCR 的"批量OCR"页面一次可导入几百张图片,任务完成后支持自动关机或待机,适合下班前挂机处理大堆档案。保存格式支持 txt、jsonl、md、csv(Excel),数据整理、归档都接得上。
PDF 方面,"文档识别"支持 pdf、xps、epub、mobi、fb2、cbz 等格式,对扫描件执行 OCR,也能提取原有文本,还能输出为双层可搜索PDF——上面是原始图像、底下藏着文本层,之后随时可以搜索和复制。处理电子书、合同扫描件,这个功能非常顶用。
学生党:截图摘抄与多语言笔记
上网课、看文献时遇到不能复制的段落,截图识别完直接存进笔记软件。Umi-OCR 的排版解析功能会自动整理文字顺序:多栏论文会按自然段正确换行,竖排(从右到左)的文字也能处理,摘抄逻辑瞬间清爽。它还内置多国语言识别库,需要识别英文、日文资料时同样顺手。
程序员:代码截图无损还原
代码截图最怕两件事:缩进丢了、特殊字符被识别歪。Umi-OCR 的排版解析里有一个"单栏-保留缩进"方案,专门为解析代码截图设计,能保留行首缩进和行中空格,注释、符号还原度都相当能打。
三个容易被忽略的宝藏功能
表面上看,Umi-OCR 只是个"截图取字"工具,但深入用下来,有几个功能非常值得专门夸一夸。
忽略区域:批量处理时的去水印神器。批量识别带水印、页眉页脚的图片时,识别结果总被无关文字污染。Umi-OCR 允许你在图片上绘制多个矩形框,框内的文字块会被整个忽略。批量处理几百张带相同水印的截图时,这一手能省下大量后期清理功夫。
二维码全家桶:扫码与生成都齐全。它不仅能从截图、粘贴、拖入的图片里读取二维码和条形码,支持一图多码,还内置了包括 QRCode、Code128、EAN13、PDF417、Aztec 等 19 种协议;反过来,也能输入文本直接生成二维码图片,并调整纠错等级。临时想做个二维码分享信息,完全不用再找在线网站。
多语言界面:装给不会中文的同事用。第一次启动会自动跟随系统语言,也可以在全局设置里手动切换。软件内置繁中、英语、日语、俄语等多种语言,把软件推荐给国外同事或家人时,不需要强迫对方适应中文界面。
全局设置里的门道
"全局设置"页虽然藏得深,但值得花一分钟逛一遍:
- 快捷方式:一键添加桌面/开始菜单快捷方式,或设置开机自启。
- 界面外观:切换语言、亮暗主题、调整字体大小和界面缩放比例。
- 窗口行为:可以设置启动时直接最小化到任务栏,配合开机自启,用起来像系统级工具一样自然。
- 渲染器:如果出现截屏闪烁或界面错位,到这里切换渲染方案或关闭硬件加速即可。
新手最容易踩的五个坑
把这些坑提前告诉你,能少走不少弯路:
| 现象 | 原因 | 应对 |
|---|---|---|
| 启动闪退 | 系统运行库缺失 | 安装 VC++ 运行库后重试 |
| 界面错位、截屏闪烁 | 显卡渲染不兼容 | 全局设置里切换渲染器或关闭硬件加速 |
| 大图识别失败 | 图像边长超出引擎限制 | 批量页设置中调高"限制图像边长"数值 |
| 识别率偏低 | 图片模糊或语言模型不匹配 | 换清晰截图,检查识别语言是否选对 |
| 命令行没反应 | HTTP 服务被关闭 | 全局设置中开启 HTTP 服务(默认开启) |
与同类方案横向对比
把 Umi-OCR 和常见的几种取字方案摆在一起,差异一目了然:
| 对比维度 | Umi-OCR | 在线识别网站 | 手机自带OCR | 商业OCR软件 |
|---|---|---|---|---|
| 是否联网 | 完全离线 | 必须联网 | 多数需联网 | 视产品而定 |
| 隐私安全 | 本地处理 | 图片上传云端 | 部分上传 | 视产品而定 |
| 费用 | 免费开源 | 免费/限次数 | 免费 | 通常收费 |
| 批量能力 | 无数量上限 | 单张或限量 | 弱 | 视产品而定 |
| 二维码 | 扫码+生成 | 较少支持 | 仅扫码 | 通常不支持 |
进阶玩法:把它塞进你的工作流
Umi-OCR 的潜力不止于图形界面,它还开放了命令行和 HTTP 接口,这两条通道让它从"一个软件"升级成"任意脚本里的一个工具"。
命令行入口就是主程序Umi-OCR.exe(Linux 下是umi-ocr)。几个高频用法:
- 截屏并自动复制结果:
umi-ocr --screenshot --clip - 识别指定图片或文件夹:
umi-ocr --path "D:/img.png" - 识别结果写入文件:
umi-ocr --screenshot --output result.txt - 读取/生成二维码:
umi-ocr --qrcode_read "D:/x.png"、umi-ocr --qrcode_create "文本" "D:/out.jpeg"
更妙的是它支持指定范围截屏,例如截取第 2 个屏幕固定区域:umi-ocr --screenshot screen=1 rect=50,100,300,200。配合快捷键工具,可以实现"按一个键就自动截取某块区域并输出文字"的自动化流程。
HTTP 接口方面,项目提供了一份完整的手册(见docs/http/README.md),包含图片识别、PDF 文档识别、二维码识别与生成的接口说明,允许程序以 Base64 或参数方式调用本地服务。比如你写个小工具自动抓取软件界面文本,把截图发给本地端口,就能拿到结构化结果——这为自动测试、内容采集等场景打开了很大想象空间。
需要动手改造的开发者,可以在仓库源码中按UmiOCR-data→py_src→qt_res的结构摸索:前者是 Python 逻辑层,后者是 QML 界面层,官方文档与构建说明也都随仓库附带。
现在就可以上手
回看整篇文章,Umi-OCR 的核心价值其实就三个词:免费、离线、全能。它把截图取字、批量转写、PDF 提取、二维码处理收进一个无需安装的绿色软件里,对办公族是效率工具,对学生党是学习助手,对程序员是能写进脚本的自动化零件,而且隐私安全、没有使用成本。
如果你手头正积压着一堆截图或扫描件,与其继续忍受在线识别的上传限制,不如花五分钟把它装起来,按下第一次 Ctrl+Shift+S,你会立刻感受到"文字随手可得"的爽快。任何工具,只有真正用起来,才算被拥有。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考