ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Umi-OCR 离线OCR使用指南:4个场景跑通截图、批量图片与PDF识别

Umi-OCR 离线OCR使用指南:4个场景跑通截图、批量图片与PDF识别 Umi-OCR 离线OCR使用指南4个场景跑通截图、批量图片与PDF识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 离线OCR是一款免费、开源的本地文字识别工具框屏截图取字、整夹图片批量转文字、扫描版PDF转成可搜索文档全程不联网、图片不上传。下面按4个真实场景把它跑起来最后给出接入自动化脚本的命令与接口。Umi-OCR 离线OCR主界面左侧预览栏可直接划选文字右侧记录栏按时间保存每次识别结果解压即用离线OCR工具怎么装发布包是.7z压缩包或.7z.exe自解压包支持 Windows 7 x64 和 Linux x64没有安装器。把发布包解压到顺手的位置解压出的目录就是全部文件。Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。主窗口弹出后界面语言跟随系统设置。打开截图OCR标签页在该页设置里确认截图快捷键可随时改键框选一块文字区域按Esc可取消。识别完成后左侧预览栏直接划选复制或点右侧对应记录文字进剪贴板。想换界面语言、主题或加桌面快捷方式、开机自启去全局设置标签页操作。临时取字框选屏幕上的代码复制时保留缩进如果你的目标是代码截图先把右侧设置里的排版解析切到单栏-保留缩进。原因OCR 引擎只负责认字文字块按什么顺序拼回去由排版解析方案决定默认的多栏-按自然段换行面向普通文档套在代码上会把缩进拍平。做法在截图OCR页框选代码区域。右侧设置面板中排版解析选单栏-保留缩进。识别完成后点这条记录复制。验证方法把结果贴进 IDE 或 Markdown 编辑器缩进层级与原图一致、没有多余空格就通过了。Umi-OCR 离线OCR的截图OCR页面右侧设置可切换排版解析方案左侧预览栏支持划选文字记录面板还允许划选多条记录批量复制右键可以复制、删除单条或清空全部识别记录面板右键菜单可复制单条记录、删除或清空全部记录发票与扫描图整夹转文字几百张图片一次出Excel手里有整文件夹的扫描单据或照片时走批量OCR标签页点选择图片或直接把文件夹拖进去几百张一次导入没有数量上限。输入图片格式jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff输出格式勾选txt / jsonl / md / csv (Excel)点开始任务后左侧列表逐张显示耗时与置信度任务结束得到每个文件对应的输出验证方法抽 3 张图对比预览和输出文本置信度0~1低于0.8的几张重点人工核对。两个高频问题水印怎么整体剔除每张图固定位置有水印或 LOGO 时从右侧设置进入忽略区域编辑器按住右键画矩形框住它。只有完整落在框内的文本块会被丢弃框画得稍微大一点更安全。大图小字认错到设置 → 文字识别 → 限制图像边长调高数值。默认960会先把大图压缩小字容易糊改2880或4320。批量OCR页面左侧是待识别图片列表含耗时、置信度右侧是识别记录扫描版PDF转双层可搜索文档原图不变文字可搜扫描件转可搜索文档打开文档识别标签页v2.1.4 及以上把文档拖进去。支持格式pdf / xps / epub / mobi / fb2 / cbz同样可设忽略区域排除页眉页脚。产物是双层可搜索PDF原图在底下识别出的文字藏在上层能搜能选版面不损失。验证方法打开生成的 PDF 按CtrlF搜一个只出现在正文里的词能直接跳到对应页说明文字层写对了。自动化接入一行命令或HTTP接口把识别挂进流水线想把 Umi-OCR 放进定时任务、打包脚本或自己的 Web 服务有命令行和 HTTP 两个口子都依赖软件内的 HTTP 服务。先到全局设置确认 HTTP 服务已允许主机保持仅本地默认端口1224。命令行走法umi-ocr是Umi-OCR.exe的简写最常用的三条umi-ocr --screenshot --clip umi-ocr --path D:/docs --output 结果.txt umi-ocr --qrcode_read D:/code.pngHTTP 走法先GET http://127.0.0.1:1224/api/ocr/get_options查参数定义再POST http://127.0.0.1:1224/api/ocr提交 base64 图片。请求体是 JSONbase64字段放图片编码options字段放语言模型、排版解析等选项文档识别、二维码各有成套接口。验证方法命令行任务跑完文字出现在剪贴板或你指定的文件里浏览器打开get_options能看到 JSON 参数定义。如果没反应多半是 HTTP 服务没开回全局设置查一下。另有一个约定命令行任务沿用截图OCR标签页的参数设定。不希望任务时弹出主窗口就在那个标签页里关掉对应选项。全局设置页可切换语言与主题、添加桌面快捷方式与开机自启并查看 HTTP 服务开关参数与故障速查常用参数参数默认值何时改为什么改排版解析多栏-按自然段换行识别代码截图时换单栏-保留缩进保留缩进与行内空格限制图像边长960大图小字识别不准时调高到 2880 或 4320避免图片先被压缩语言/模型库简体中文内容为纯英文、纯代码时换models/config_en.txt减少怪字符OCR引擎插件Rapid-OCR自带精度或速度不满足时在全局设置里切换日常使用保持默认即可HTTP服务开启仅本地端口 1224命令行/接口无响应时确认已允许且主机为仅本地界面改动会自动存进UmiOCR-data/.settingsini 格式也可以手动改改完执行umi-ocr --reload重新加载。问题排查现象原因处理识别顺序错乱、读不通排版解析方案与图片排版不匹配换方案代码选单栏-保留缩进大图里的小字认错边长限制 960 先压缩了图片限制图像边长调到 2880 以上水印、LOGO 文字混进结果水印里的文本块被一起识别批量页忽略区域把水印整块框住命令行 / HTTP 没反应HTTP 服务没开全局设置里允许 HTTP 服务主机选仅本地下一步去哪儿命令行手册范围截图、粘贴图片、二维码与输出重定向的完整指令HTTP接口手册图片识别、文档识别、二维码接口的完整参数更新日志各版本功能变化Python 源码在UmiOCR-data/py_src/目录里想弄清识别任务怎么调度的话可以直接翻。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表