ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

扫描件合同Ctrl+F终于搜到了|OCRmyPDF·多语言OCR:中文/日文/韩文

扫描件合同Ctrl+F终于搜到了|OCRmyPDF·多语言OCR:中文/日文/韩文 扫描件合同CtrlF终于搜到了OCRmyPDF·多语言OCR中文/日文/韩文【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF在扫描合同里输入付款日期一搜空空如也因为文件里只有图像没有文字。OCRmyPDF 给扫描版 PDF 加上可搜索的文字层中文这类多语言 OCR 则要先装 Tesseract 语言包、指定语言代码 chi_sim。跑通它3分钟给合同装上文字层 pip install ocrmypdf ocrmypdf -l chi_sim contract.pdf contract_ocr.pdf怎么算成功打开 contract_ocr.pdf鼠标能选中文字CtrlF 搜付款日期能命中。注意 Tesseract 恰好是 5.4.0 会直接报错装 5.3.x 或 5.5 即可。只讲一件事多语言OCR靠的是语言包Tesseract 像个只会翻译学过语言的人语言包就是它的学过记录。没有 chi_sim 语言包时汉字再清晰它也读不出来输出是乱码或空。所以多语言 OCR 第一步不是调参数而是先查装了哪些语言tesseract --list-langs只看到eng说明你的中文全乱码不冤。语言代码是三位 ISO 639-2 码chi_sim 简体、chi_tra 繁体、jpn 日文、kor 韩文、jpn_vert 竖排日文。混排文档用连接比如-l chi_simjpn。识别逻辑在 Tesseract 插件实现 里。按你的环境走一套系统一条安装命令 Debian/Ubuntu Linuxsudo apt-get install tesseract-ocr-chi-simFedora/RHEL换成sudo dnf install tesseract-langpack-chi_sim。macOSbrew install tesseract-lang这个包把所有语言包一次装齐。WindowsChocolatey 版默认只有英语。把chi_sim.traineddata语言包文件手动放进安装目录下的 tessdata 文件夹通常是C:\Program Files\Tesseract-OCR\tessdata\。Docker基于官方镜像派生一个在构建时装包FROM jbarlow83/ocrmypdf RUN apt-get update apt-get install -y tesseract-ocr-chi-sim各发行版包名差异详见 语言包安装文档。调参靠因果不靠猜别先调参数看到现象再改。常用就这三个中文认得支离破碎→ 加--tesseract-oem 1切到 LSTM 神经引擎。扫描页背景发黄、光线不均、错字多→ 加--tesseract-thresholding adaptive-otsu用自适应二值化自动把字和背景分开先清理页面。扫描分辨率高得离谱OCR 慢或报图像超限→ 加--tesseract-downsample-above 20000超过 20000 像素的页自动缩小再识别。速查表参数什么时候加--tesseract-oem 1中文乱码切 LSTM 引擎--tesseract-thresholding adaptive-otsu背景发黄、光线不均--tesseract-downsample-above 20000高分辨率扫描慢或报图像超限--tesseract-pagesegmode 5竖排日文文档--user-words words.txt专业术语总被认错参数定义与校验逻辑可看 Tesseract 调用封装。踩过的坑用户常问语言包装了还是报语言 zh 不可用一句话根因代码必须是三位 ISO 码。修复-l chi_sim别写-l zh或-l cn。我上周刚踩了输出里某几页是空的日志报图像尺寸超限。Tesseract 单边像素上限是 32767。修复--tesseract-downsample-above 20000。用户常问竖排日文按横排认一塌糊涂。根因是用了横排 jpn 包。修复-l jpn_vert --tesseract-pagesegmode 5竖排包和 PSM 5 一起用。直接抄三条多语言OCR命令# 中文合同批量给当前目录所有 PDF 加文字层按 PDF/A 存档 for f in *.pdf; do ocrmypdf -l chi_sim --output-type pdfa $f ocr_$f; done# 中日英混合论文三语用 连接LSTM 引擎 ocrmypdf -l chi_simjpneng --tesseract-oem 1 paper.pdf paper_ocr.pdf# 竖排日文竖排语言包 PSM 5 ocrmypdf -l jpn_vert --tesseract-pagesegmode 5 vertical.pdf vertical_ocr.pdf【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表