ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何离线做 OCR?用 Umi-OCR 搞定截图识别、批量图片识别、PDF 识别与二维码

如何离线做 OCR?用 Umi-OCR 搞定截图识别、批量图片识别、PDF 识别与二维码 如何离线做 OCR用 Umi-OCR 搞定截图识别、批量图片识别、PDF 识别与二维码【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR手头有一份扫描版合同几百张截图等着转文字屏幕上偶尔划一块字要用脚本里还想自动出一批二维码。Umi-OCR 是一款免费、开源、完全离线的 OCR 工具截图识别、批量图片识别、扫描版 PDF 转可搜索文本、二维码扫描与生成全部在本地完成图片不上传、不注册、识别次数不设上限。这篇指南按输入的东西长什么样来带你走先备环境再分别处理一整份文档、一文件夹图片、一小块屏幕最后把它接进自动化。准备环境解压即用离线 OCR 工具备齐不用安装。从 Release 页拿到.7z压缩包没有解压软件的机器可以用.7z.exe自解压包或者git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR获取源码。解压到纯英文路径比如D:\Tools\Umi-OCR路径里避开中文和空格能少踩很多兼容性问题。Windows 双击Umi-OCR.exe启动v2.1.3 起 Linux 也支持运行umi-ocr.sh。软件内置 OCR 引擎和运行库部分杀软会误报启动前把目录加进白名单比较稳妥。主界面由一组标签页组成截图OCR、批量OCR、文档识别、二维码、全局设置右上角可以锁定标签页防误关左上角有窗口置顶开关。首次启动会按系统语言自动切换界面也可以在全局设置 → 语言/Language 里手动选简中、繁中、英文、日文、俄语、葡萄牙语等。整份扫描文档把死 PDF 变成可搜索 PDF最典型的场景一柜子的扫描旧书、旧合同页面上只有图像搜不到、选不中任何字。打开文档识别标签页v2.1.0 起支持输入格式覆盖pdf、xps、epub、mobi、fb2、cbz。把处理逻辑想成先挑现成的再补缺的解析器底层依赖 PyMuPDF会区分 PDF 里自带的文本层和扫描图片层。自带文本的页面直接提取快且零识别误差只有纯扫描页才交给本地 OCR 引擎。你也可以反向指定整页强制 OCR或只提取原文本。输出有两种成品按用途挑输出格式特点适合场景双层可搜索 PDF底层保留原图上层叠透明文字层外观不变但可搜索、可复制历史合同归档、论文数字化单层纯文本 PDFv2.1.2 起文件更小方便二次编辑只要文字、不在乎原版外观页眉页脚位置固定时用按页码范围设置的忽略区域一次性排除比逐页手动删干净得多。长任务还能设置完成后自动关机/待机睡前扔进去早上收结果。一文件夹图片几百张拖进来逐张出结果走到批量OCR标签页把图片直接拖进窗口没有数量上限几百张都行。项目支持范围输入格式jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff输出格式txt、jsonl、md、csvExcel 可直接打开右侧面板逐张显示耗时、置信度和识别结果跑完按需要选输出格式落盘。长任务有两个实用开关任务完成后自动关机/待机v2.1.2 起支持暂停任务只要不退出软件待机/休眠回来任务还能恢复。真正省事的地方在于忽略区域编辑器批量图的角落里常混着水印、LOGO每次都进结果。在批量页右侧设置里打开编辑器按住右键在图上画多个矩形框住水印可能出现的位置。必须记住一条机制只有整个文本块完全落在框内才会被忽略按单个字符不算。所以框要画得足够大把水印所有可能落位都包住框小一号结果里就多一行杂音。屏幕上的一小块截图识别的正确打开方式截图OCR标签页里按快捷键唤起截图框划出文字区域结果立刻出现在右侧记录栏。几个比截图本身更好用的细节不截图也能识别在别处复制一张图片比如聊天窗口里的图切回软件直接粘贴效果相同。结果可以直接改记录栏文字支持编辑划选多条记录可一次复制省去跳转编辑器整理。重复上一次截图的快捷键可以省掉重复划选的动作v2.1.0 起支持。顺手的二维码能力识别与生成都在本地二维码标签页支持截图、粘贴、拖入图片三种方式一张图里多个码也能一次读出。覆盖 19 种码制包括 QRCode、EAN13、Code128、DataMatrix、PDF417、Aztec 等。生成方向则支持选码制、纠错等级把文本直接输出成二维码图片命令行下还能指定尺寸批量生成见下文。识别质量调优引擎、语言库与排版方案引擎与语言库两个开关分开调全局设置里内置两套离线引擎随时切换RapidOCR兼容性好识别不准或报错时先换它试试。PaddleOCR速度稍快v2.1.4 起默认内存占用限制在系统总内存的一半以内想再压低可在插件配置里调低线程数。另外注意界面语言和识别语言库是两回事。界面语言管菜单显示什么文字识别语言库管引擎认哪种文字在各标签页的文字识别设置里单独选择或下载。界面用中文、日常识别日文书籍这种组合完全成立。排版解析给散装文字排顺序引擎吐出来的是散装文本块排版解析器负责决定谁先谁后。内置预设方案方案适用场景多栏-按自然段换行两栏/三栏排版的论文、书籍默认推荐覆盖大多数场景多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制整段合并成一行单栏-按自然段换行 / 总是换行 / 无换行与多栏系列对应但不区分多栏布局单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理引擎原始输出不整理拿不准就留多栏-按自然段换行代码截图请切到单栏-保留缩进。各方案都能自动处理横排和竖排从右到左排版。性能三件事长截图、大图识别不完整页面设置 → 文字识别 → 调高限制图像边长。不要靠放大原图解决过度放大会引入噪声。内存占用偏高PaddleOCR 插件配置里调低线程数。截图闪烁、界面错位全局设置 → 界面和外观 →渲染器换渲染方案或关闭硬件加速。常见问题现象、原因、对策现象原因对策代码截图缩进全乱了默认排版方案会合并空格排版解析切到单栏-保留缩进旋转方向的扫描件文字位置错位早期版本提取文本层时未处理页面旋转v2.1.5 已修复升级到最新版拖入数万个文件的文件夹界面卡死大量文件同步加载v2.1.5 改为异步加载并显示进度等跑完再操作命令行指令没反应HTTP 服务未开或用了备用启动器入口确认全局设置里 HTTP 服务开启入口必须用主程序Umi-OCR.exeRUN_GUI.bat这类启动器不支持命令行长图识别缺头少尾限制图像边长默认值较低大图被压缩调高该数值别直接放大原图忽略区域画了水印还在框没完整包住整个文本块或配置没保存框大一号确认已保存截图时屏幕闪烁、界面错位显卡渲染兼容问题切换渲染方案或关闭硬件加速接进自动化命令行与本地 HTTP 接口走到这一步你可以把 Umi-OCR 当成一台本地 OCR 服务来用。命令行入口就是主程序Windows 为Umi-OCR.exeLinux 为umi-ocr所有指令支持前缀简写--screenshot可写成--scumi-ocr --screenshot --clip截屏识别结果直接进剪贴板。umi-ocr --path D:\scans -- all.txt递归识别整个文件夹含子目录结果追加到all.txt。umi-ocr --screenshot screen1 rect50,100,300,200免鼠标划选直接截取第 2 块显示器上(50,100)起点、300×200 大小的区域。配合快捷键工具可以做成按一下 F10 识别固定区域。完整参数见 docs/README_CLI.md。注意两点命令行走本地 HTTP 环回通信要求 HTTP 服务开启默认开启仅监听本地环回不经过物理网卡受运行环境限制系统管道重定向符、|可能失效需要程序化收结果时改用 HTTP 接口。HTTP 接口软件运行期间本地 HTTP 服务暴露图片识别、文档识别PDF 识别、二维码识别/生成等接口文档在 docs/http/。几十行代码就能封装成传图 → 返回 JSON 结果的小服务接进自己的脚本或局域网工具里。下一步下载最新版 v2.1.5把这两件事做完给文档识别页跑一份扫描版 PDF产出双层可搜索 PDF在批量页把忽略区域画好。之后你手头的带水印图片、整柜扫描旧书都能直接产出干净、可搜索的文本。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表