ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

TeleOCR公式识别:扫描文档中的数学公式一键还原为LaTeX

TeleOCR公式识别:扫描文档中的数学公式一键还原为LaTeX TeleOCR公式识别扫描文档中的数学公式一键还原为LaTeX【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 公式识别TeleOCR 是一个约 1.2B 参数的开源轻量文档解析视觉语言模型OCR它的核心能力之一就是把扫描文档、论文截图中的数学公式一键还原为可编辑的 LaTeX 代码。无论是电子版 PDF 还是相机翻拍的扭曲文档TeleOCR 都能直接解析无需专门的公式矫正模型公式识别精度Formula CDM在 OmniDocBench v1.6 上达到 96.36 的业界领先水平。为什么公式图片转 LaTeX这么难对普通 OCR 来说文字→文本已经够用但公式是个例外公式有上下标、分式、求和、根号、矩阵等二维结构纯文本无法表达扫描件常伴随倾斜、透视变形、模糊传统做法要先做矫正预处理很多模型只能识别公式长什么样却写不出人能继续编辑的 LaTeX 源码。TeleOCR 用统一的视觉语言框架同时覆盖数字文档和相机拍摄文档借助几何感知的文档建模Geometry-aware Document Modeling对变形文档也能直接解析省去了去畸变预处理这一步。TeleOCR 环境安装一条命令搞定模型基于 Hugging Face Transformers 生态加载安装依赖非常简单pip install transformers torch pillow如果你想克隆仓库查看完整的示例图片与配置文件git clone https://gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR cd TeleOCR仓库里的关键文件均可直接点击查看完整说明与调用示例README.md模型结构自定义代码modeling_naviocr.py模型配置Qwen2.5-VL 架构、bfloat16config.json词表与特殊 tokenadded_tokens.json、tokenizer_config.json模型权重model.safetensors三步完成公式识别从扫描图到可编辑 LaTeX下面以仓库自带的公式样例 assets/formula.png 为例——一张包含组合数恒等式推导的论文截图第 1 步加载模型约 1.2B 参数单卡 GPU 即可运行from PIL import Image import torch from transformers import AutoProcessor, AutoModel processor AutoProcessor.from_pretrained(StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue) model AutoModel.from_pretrained(StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16).cuda().eval()第 2 步用一句自然语言提示词发起识别image Image.open(assets/formula.png).convert(RGB) prompt Please write out the expression of the formula in the image using LaTeX format.第 3 步得到 LaTeX 输出模型会输出形如下面的 LaTeX 源码中间推导步骤省略$$\binom{\alpha}{n}-\binom{\alpha-1}{n}\frac{1}{n!}\alpha(\alpha-1)\cdots(\alpha-n1)-\cdots\binom{\alpha-1}{n-1}$$得到代码后粘贴进任何支持 LaTeX 的编辑器Markdown、Word、Typora 等即可继续编辑。小贴士官方示例中会用几行后处理把输出统一包裹成$$...$$定界符方便直接嵌入文档逻辑见 README.md 中的post_process函数。TeleOCR 公式识别到底多准在多个公开文档解析基准上TeleOCR 的公式识别Formula CDM与整体得分都位于第一梯队数据来源README.md 实验结果章节基准测试TeleOCR1.2B表现OmniDocBench v1.6Overall96.87Table TEDS97.05Wild_OmniDocBench野外拍摄文档Overall88.53全榜第一PureDocBench含退化/真实模糊场景干净与退化场景均为同级最优ICDAR2026 Sci-ImageMiner 竞赛第 1 名它不只是公式识别准——文本、表格、代码、版式、甚至科学插图中的隐含表格都可在同一个模型里完成配合仓库内的样例图片 assets/text.png、assets/table.png、assets/scientific_figure.png 可以逐一体验。新手常见避坑指南 必须加trust_remote_codeTrueTeleOCR 使用自定义建模代码auto_map指向 modeling_naviocr.py不加会加载失败精度用 bfloat16与 config.json 中dtype: bfloat16保持一致显存占用与精度更平衡拍歪的文档不用先矫正TeleOCR 具备几何感知建模能力直接丢进去解析即可输出格式公式默认输出 LaTeX 源码后处理会统一成$$...$$表格则输出 OTSL/HTML可按需转换。小结 如果你常被论文里的公式没法编辑、扫描文档里的公式无法复用困扰TeleOCR 公式识别给出了一个轻量又准确的方案装好依赖 → 加载模型 → 一句话提示词三步就能把数学公式图片还原成 LaTeX。更多完整文档解析玩法可参考仓库内的 README.md 与 chat_template.jinja。【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表