ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

图片里的文字复制不出来?Umi-OCR 离线识别工具,截图、批量、PDF 一篇搞定

图片里的文字复制不出来?Umi-OCR 离线识别工具,截图、批量、PDF 一篇搞定 图片里的文字复制不出来Umi-OCR 离线识别工具截图、批量、PDF 一篇搞定【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR每天都有无数人卡在同一个坎上图片里的字明明看得见却复制不出来。网页上的 OCR文字识别工具不是要登录就是限量限大小敏感资料还得先传到别人服务器。这篇 Umi-OCR 离线识别软件使用指南就是为被这事折磨的你准备的——读完照着做截图、批量、PDF 全都能自己搞定。一句话先给结论Umi-OCR 是一款免费、开源、完全离线的 OCR 文字识别软件。它不需要注册账号不需要联网解压就能用截图识别、批量图片、PDF 文档、二维码扫描与生成全部内置还自带多国语言识别库。你可以把它理解成一位住在你电脑里的文字速记员——随叫随到、口风严密图片和文档从头到尾不离开你的硬盘。两分钟开箱解压就算装完真的不用安装Umi-OCR 是纯绿色软件上手只需要三步下载去项目发布页拿.7z压缩包电脑没装解压软件就选.7z.exe自解压包双击自己解开。解压解压到任意目录比如D:/Tools/Umi-OCR路径里别带中文和空格能省掉不少莫名其妙的兼容问题。启动双击Umi-OCR.exeWindowsLinux 用户运行umi-ocr.sh即可。第一次启动软件会自动读取系统语言并把界面切成对应语言想手动切换随时去全局设置里改。程序主体是一排标签页——截图OCR、批量OCR、文档识别、二维码、全局设置用法和浏览器标签栏一样。常用页面右上角有个锁定按钮点了就再也不会误关。小提醒启动前最好把软件目录加进杀毒软件白名单。因为内置了本地 OCR 引擎和运行库个别杀软会误报加个白名单能省掉很多为什么突然闪退的烦恼。三大高频任务截图、批量、PDF各有各的省事姿势与其背功能列表不如直接看这三个最常用的场景。它们覆盖了从日常摘抄到批量归档的绝大多数需求。任务一屏幕上的字划一下就进剪贴板切到截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏里。几个顺手的小习惯图片不用先保存再打开在聊天窗口复制一张图回到 Umi-OCR 直接粘贴就能识别。结果当场可改右侧记录栏的文字能直接编辑还能划选多条一起复制识别完顺手就能整理成想要的格式。竖排也不怕排版解析会自动处理横排和竖排从右到左的文字只要当前识别库支持竖排即可。任务二上百张图一次全喂进去切到批量OCR标签页把图片直接拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式没有数量上限一次拖几百张也行。点下开始任务右侧会逐张显示耗时、置信度和识别内容。跑完可以输出成txt、jsonl、md、csvExcel 能直接打开四种格式。想挂机设置任务完成后自动关机/待机睡前丢进去几百张醒来直接收结果。中途要休息也没关系v2.1.2 起支持暂停任务只要软件不退出待机回来还能继续跑。加分项让水印、页眉页脚自动隐身批量识别有个高频痛点图片角落的水印、LOGO、页眉页脚总是混进结果还得人工删。在批量页右侧设置里进入忽略区域编辑器按住右键在图上画出多个矩形框把这些位置框住识别时框内文字就会被自动排除。这里有个必须记牢的机制只有完全落在框里的整个文本块才会被忽略单个字符可不会。所以画框宁可大一点把所有可能出现水印的位置都包住否则漏框一次结果里就多一行杂音。任务三扫描版 PDF变回能搜能复制的文档文档识别是压轴戏支持pdf、xps、epub、mobi、fb2、cbz六种格式最典型的用法就是把扫描版 PDF 变成可搜索文本。它的工作逻辑可以概括为三步解析 → 识别 → 重组。PDF 先被拆开区分出本来就带文本层和需要 OCR 的扫描图片层扫描层交给本地引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。两个亮点值得展开双层可搜索 PDFOCR 后输出底层原图、上层透明文字的双层 PDF。外观和原扫描件一模一样但文字可以搜索、复制、划线。历史合同归档、论文数字化这个功能能直接顶上去。灵活的提取策略软件会优先提取 PDF 自带的文本层速度快、零识别误差遇到纯扫描页才自动切到 OCR。你也可以主动选整页强制 OCR或反过来只提取原文。v2.1.2 起还能输出单层纯文本 PDF想要体积小、好编辑的文件就选它。文档识别同样支持忽略区域可按页码范围设置用来排掉扫描件的页眉页脚也能设置任务完成后自动关机。三个旋钮语言、排版、性能按需拧界面语言 vs 识别语言库两码事界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等在全局设置 → 语言/Language里切换。但注意界面语言和识别语言库是两回事界面语言管按钮菜单长什么样识别语言库管 OCR 引擎认哪种文字后者在各标签页的文字识别设置里单独选择或下载。界面用中文、日常识别日文书完全可以搭配着来。排版方案给识别结果排座位OCR 引擎吐出的字是散装的谁先谁后要靠排版解析来管。内置的预设方案不少挑对了才省事方案典型场景一句话点评多栏-按自然段换行两栏/三栏论文、书籍拿不准就选它覆盖绝大多数场景多栏-总是换行需要按行处理的场景每句独立成行多栏-无换行想整段合并成一行强制压成一行单栏-按自然段换行单栏文档段落自然断行单栏-保留缩进代码截图保住行首缩进和行中空格不做处理想要原始输出引擎默认原样返回其中单栏-保留缩进值得单独表扬把代码截图丢进去输出能基本保持缩进结构配合截图 OCR 一起用堪称程序员小帮手。性能大图、内存、闪烁各有一招长图识别不完整到文字识别设置里调高限制图像边长。默认限制是为了平衡速度与内存遇到像素特别大的长截图适当调高数值就行但别盲目放大原图——过度放大会增加噪点反而降低准确率。内存占用偏高PaddleOCR 插件从 v2.1.4 起默认把内存占用限制在系统总内存的一半以内还想再省去插件配置里调低线程数。截屏闪烁、界面错位多半是显卡渲染兼容问题。去全局设置 → 界面和外观 → 渲染器换个渲染方案或直接关掉硬件加速通常能解决。新手避坑8 个高频疑问对号入座把最常见的报错和误区整理成一张诊断表遇到问题直接找原因症状原因解法忽略区域画了没效果文本块没有完全落在框内把框画大、整块包住确认保存了忽略区域配置长图识别缺胳膊少腿图像边长超出默认限制调高限制图像边长而不是放大原图截图时屏幕闪烁、错位显卡渲染兼容问题切换渲染器或关闭硬件加速命令行指令没反应HTTP 服务被关闭了在全局设置里打开 HTTP 服务默认开启仅监听本地环回、不经过物理网卡数据不会外泄批量任务想中途休息版本太老升级到 v2.1.2 及以上支持暂停待机后继续代码截图排版全乱排版方案不对换单栏-保留缩进多栏论文顺序串行排版方案不对换多栏-按自然段换行超大文件夹加载很卡文件数量太多v2.1.5 起已优化异步加载等进度条走完再操作进阶玩法命令行、HTTP 接口与引擎生态对普通用户来说图形界面已经够用但想把它嵌进自己的工作流还有两条程序化通道。命令行模式入口就是主程序本身# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果写到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录-- 是 --output 的简写 umi-ocr --path D:/scans -- result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256所有指令都支持用前几个字母简写比如--screenshot写成--sc。配合 HotkeysCMD 之类的快捷键工具还能实现按一个键就自动截固定屏幕区域并识别的骚操作。完整参数说明见命令行手册 docs/README_CLI.md。HTTP 接口启动后本地 HTTP 服务会提供 OCR、文档识别、二维码等接口接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成小工具或接入自己的自动化流程实现上传图片 → 返回 JSON 识别结果。引擎与插件生态软件默认内置 Rapid-OCR兼容性好和 PaddleOCR速度稍快两套引擎全局设置里随时切换项目还有独立的插件库可以扩展更多 OCR 引擎。公式识别等功能则列在开发路线图上属于远期计划可以保持关注。版本别落后CHANGE_LOG.md记录了每个版本的演进——v2.1.0 加入文档识别v2.1.2 支持单层纯文本 PDF 与任务暂停v2.1.3 登陆 Linux 并支持 Docker 部署v2.1.5 修复了 PDF 页面旋转导致的文本错位问题。如果你手头有旋转过方向的扫描件一定要用最新版。写在最后三句话总结Umi-OCR 免费、开源、离线运行装好就能用截图、批量、PDF 三大场景从日常摘抄到批量归档全都覆盖遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版合同、带水印的图片或是一堆等着整理的截图时打开 Umi-OCR——你会发现自己已经不需要在线工具也不用再逐字手打了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表