ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从科学图表中挖出隐藏数据:TeleOCR图表表格提取完整教程

从科学图表中挖出隐藏数据:TeleOCR图表表格提取完整教程 从科学图表中挖出隐藏数据TeleOCR图表表格提取完整教程【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 是一款轻量级约 1.2B 参数开源文档解析视觉语言模型专为从科学论文与技术文档中提取图表、表格和公式而设计。它支持将论文插图中的隐含数据转化为结构化表格同时覆盖文本识别、公式还原LaTeX、代码提取和版面分析等任务无需复杂前处理让科研数据提取变得简单高效。为什么选择 TeleOCR 做图表表格提取 传统 OCR 工具处理科学论文时常常遇到这些痛点表格结构丢失合并单元格、跨行表格被简单打散公式无法还原数学公式只能识别为乱码或纯文本图表数据不可用论文插图scientific figure里的隐含表格数据无法提取拍摄文档变形手机翻拍的弯曲页面需要额外矫正步骤TeleOCR 通过内容-结构解耦学习技术专门优化了表格与公式解析能力在 OmniDocBench v1.6 基准测试中以96.87 分总成绩位居专项模型第一且对手机拍摄的变形文档同样表现稳健。快速安装与模型初始化安装依赖只需一行pip install transformers torch pillow模型核心文件均位于仓库根目录主要文件包括文件说明modeling_naviocr.py自定义模型架构基于 Qwen2.5-VLconfig.json模型配置28 层 Transformer、1.2B 参数tokenizer.json / vocab.json分词器与词表chat_template.jinja对话提示模板model.safetensors模型权重初始化代码非常简洁from transformers import AutoProcessor, AutoModel import torch processor AutoProcessor.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue ) model AutoModel.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16, ).cuda().eval()图表表格提取3 步出数据第 1 步准备输入图像将目标图表截图保存为 PNG 或 JPG 文件即可。TeleOCR 直接读取原始图像无需裁剪、矫正或预处理。第 2 步编写提示词并推理针对不同提取任务只需更换 promptfrom PIL import Image # 科学图表 → 隐含表格 image Image.open(./your_figure.png).convert(RGB) prompt This is a scientific figure. Please extract the table implied by this figure. # 普通文档表格 # prompt This is the image of a table. Please output the table in OTSL format. # 数学公式 # prompt Please write out the expression of the formula in the image using LaTeX format. raw_output infer(image, prompt) # infer 函数见 README 完整示例第 3 步转换输出为可用格式表格输出采用OTSLOptimized Table Structure Language格式包含fcel首单元格、lcel跨行、nl换行等特殊标记。通过convert_otsl_to_html()函数可一键转为标准 HTML 表格html_table convert_otsl_to_html(raw_otsl_output) print(html_table) # 输出: tabletrtd.../td/tr/table完整解析逻辑参考 README.md 中的convert_otsl_to_html与post_process函数实现。支持的 5 种提取场景速查场景提示词Prompt输出格式科学图表 → 数据表This is a scientific figure. Please extract the table implied by this figure.OTSL → HTML 表格文档内表格This is the image of a table. Please output the table in OTSL format.OTSL → HTML 表格数学公式还原Please write out the expression of the formula in the image using LaTeX format.LaTeX$$...$$正文文本识别Please output the text content from the image.纯文本页面版面分析Analyze the image layout.结构化区块描述提示词技巧TeleOCR 本质是一个视觉语言模型你可以用自然语言描述任务不必严格限定格式。拍摄文档的变形鲁棒性手机翻拍的论文页面往往存在严重透视变形。TeleOCR 内置几何感知文档建模能力可直接对弯曲文档进行版面解析无需额外调用矫正模型# 变形文档的版面分析 distorted_image Image.open(./captured_page.jpg).convert(RGB) distorted_image distorted_image.resize((1036, 1036), Image.Resampling.BICUBIC) prompt Multi-point Layout Segmentation Analysis. result infer(distorted_image, prompt)实用技巧与注意事项5 个提升提取质量的技巧图像尺寸版面分析任务建议将输入 resize 至1036 × 1036可显著提升精度公式后处理模型输出的 LaTeX 可能带\[\]包裹提取后记得去除外层符号合并单元格OTSL 格式天然支持rowspan/colspan转换后的 HTML 表格结构完整推理参数使用torch.bfloat16do_sampleFalse可获得最稳定的输出多任务复用只需更换 prompt 即可在同一模型上执行不同解析任务无需加载多个模型总结TeleOCR 将读图 → 理解结构 → 输出数据的完整流程压缩为一次推理调用特别适合 批量提取论文中的实验数据表格 将图片中的数学公式转为可编辑的 LaTeX 处理手机翻拍的变形文档 从科学插图scientific figure中恢复隐含数据配合 README.md 中的完整示例代码你可以在10 分钟内搭建起自己的文档解析管线从图表中真正挖出那些隐藏的数据。【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表