ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

别再无脑堆数据了:腾讯 WeVisDoc 把文档解析卷到 95 分,token 是按预算花的

别再无脑堆数据了:腾讯 WeVisDoc 把文档解析卷到 95 分,token 是按预算花的 一句话总结腾讯把 WeVisDoc 的 backbone 锁死在 Qwen3-VL 2B/4B 上只靠两阶段数据工程——先铺覆盖、再按残差补短板——把端到端文档解析推到 OmniDocBench 95.38 分的第一梯队而且增益几乎全部落在拍照、影印这类真实退化页面上。对做数据管线的同学来说这篇真正的干货是那套「按 token 预算配数据」的账本算法。做文档解析的都知道现在有多卷dots.ocr、DeepSeek-OCR、GLM-OCR、PaddleOCR-VL……端到端解析模型几乎月月出新OmniDocBench 的分数也开始了 90 通货膨胀。你的感受大概和我一样再看下去分数已经分辨不出好坏模型了。那下一步卷什么腾讯 WeVisDoc 团队给的答案特别朴素别动模型去算数据的账。这篇论文从头到尾没提任何新架构——backbone 就是现成的 Qwen3-VL2B 和 4B 两个尺寸全程锁死输出格式、训练目标也全部固定。它只回答一个问题训练语料要怎么建、怎么分配才能让解析器在干净页面和脏页面上都可靠想自己上手资源在这 论文 · arXiv 2609.20423 代码 · GitHub · Tencent/WeVisDoc 模型 · HuggingFace · WeVisDoc-4B / WeVisDoc-2B 项目主页 · tencent.github.io/WeVisDoc 先问一个扎心的问题你缺的是数据还是训练这是全文最值钱的洞察。做数据管线的团队经常把两件事混在一起说「加数据」扩覆盖收集、检索、合成新数据——让模型见过以前没见过的版式加暴露对已有数据重加权、重采样——让模型多练已经见过的弱项。这两者是完全不同的干预。更麻烦的是残差错误高不等于覆盖有缺口误差可能来自标注本身不可靠、图片糊到内容不可读、解码失败停不下来或者干脆是模型容量到顶了。这些情况下你再补一万张相似的图预算也是白烧。还有一个特别容易踩的坑按「条数」配数据。一条整页论文的标注可能上万 token一条孤立公式只有几十 token。按记录数一比一配比等于让「一条公式」和「一篇论文」在训练里说了同样多的话——这显然不对。WeVisDoc 的解法是把所有预算统一换算成loss-bearing target tokens真正计入损失的目标 token 数再用长度修正公式反推每条记录的采样概率。这个口径转换几乎可以直接抄到任何自回归 parser 的数据配比里。️ 两阶段打法先铺地板再补短板Stage I 叫「广覆盖构建」目标是把语义、结构、外观三个维度的地板铺平。数据来自四个异构来源开源数据集、内部生产文档、定向爬取、程序化合成统一转成整页、区域、组件三种粒度。这里有两个设计值得展开。一是双编译合成用语义 HTML 当中间表示一份页面程序同时编译出两个东西——渲染出来的页面图像和精确到节点 ID 的结构化标注阅读顺序 Markdown、HTML 表格、LaTeX 公式。监督信号来自生成源而非事后标注所以阅读顺序这类最难标的信息是免费拿到的。二是「一致性不等于正确性」的标注哲学三个专家 parserMinerU2.5-Pro、PaddleOCR-VL-1.6、dots.mocr两两算归一化编辑距离全对上才算高置信候选——但三个模型可能在同一个表格上犯一样的错所以高误差样本还必须归因是标注错、模型错还是图本身看不清分不清就不许进训练。Stage I 练出第一版模型后Stage II「能力感知精修」开始还债。流程是在与训练完全解耦的留出探针上按视觉-结构聚类逐簇测残差——哪个簇的模型还在犯错就定向合成哪类数据公式密集页、嵌套表格、报纸排版……再把硬例过采样、Stage I 数据 replay 按固定 token 预算重新分配。重分配那步做得相当克制提案分布由「自然 token 份额 × 残差严重度」加权生成然后 KL 投影回「相对自然份额有上下界」的可行域。说白了就是弱项可以加练但不许把训练分布扭曲到忘了正事。 脏页面才是主战场退化增强的准入条件文档解析的真实场景是什么是用户拿手机拍合同、扫老化影印件、翻拍屏幕——不是论文 PDF 的原生数字页。WeVisDoc 按物理采集路径组织退化算子影印要依次经过纸张油墨、设备复制、相机拍摄三段变换屏幕翻拍有摩尔纹和彩色条纹还有透视、曲面、折痕、运动模糊。关键在准入条件退化之后只有所有被监督的内容仍然可见可读原标注才继续有效糊到标注不再成立的样本直接拒绝或者改派「可见内容裁切」目标。这个设计防的是退化增强最常见的翻车方式——不是「不够糊」而是「糊到监督信号变成噪声」。 效果到底怎么样数字都在这了先看主战场 OmniDocBench v1.6Overall 为文本、公式、表格三项的平均越高越好类别模型规模Overall↑FormulaCDM↑TableTEDS↑通用 VLMGemini 3 Pro–92.9195.9989.15流水线PaddleOCR-VL-1.60.9B96.3397.4994.76流水线MinerU2.5-Pro1.2B95.7597.4593.42端到端HunyuanOCR-1.51B94.7494.5093.67端到端WeVisDoc2B95.0695.9493.03端到端WeVisDoc4B95.3896.8192.954B 拿下 95.38在端到端组里排第一领先前名 HunyuanOCR-1.5 零点六四分2B 更有意思——一半的参数量分数只差 0.32数据工程实打实顶替了一部分参数规模。更能说明问题的是阶段对比。Stage I 到 Stage II 用的是同样的 token 预算增益却不是平均分布的规模阶段Clean↑Digital Degraded↑Real Degraded↑4BStage I 广覆盖79.3275.1965.054BStage II 精修79.81 (0.49)77.74 (2.55)69.08 (4.03)增益沿「干净页 数字退化 真实退化」单调放大4B 在真实退化赛道上白拿 4.03 分干净页只动了 0.49。这说明 Stage II 的补课真的落在了分布尾部——也就是用户实际遇到的那些拍照件上。定性案例也支持同一个故事Stage II 系统性地修掉了漏表格、按列误串阅读顺序、字段值不配对、跨文档幻觉这几类失效。但注意作者自己也承认真实退化案例里仍残留字符级转写错误——结构恢复变强不等于物理采集下的识别错误消失。 泼冷水时间这些地方要打问号按惯例说说不能全信的部分这篇的问号还不少Stage II 是复合干预继续训练、硬例过采样、定向新数据、replay 一起上作者三度主动声明「无法归因到残差重分配这一个机制」。想抄「按残差调配比」这个单点的同学要清楚支持它的证据并不存在那 4.03 可能大部分只是「多训一轮 难例多抽几次」。缺一个近乎零成本的对照把 Stage II 的预算拿去做 Stage I 数据的随机重采样就能排除「过度工程」质疑——论文没做。表格是短板4B 的 TableTEDS 92.95低于 PaddleOCR-VL-1.6、MinerU2.5-Pro甚至低于自家 2B93.03。正文宣称领先时用了一个未解释定义的 TableTEDS_S 变体微妙地绕开了这项。领先幅度贴着标注噪声论文自己引用的审计显示 OmniDocBench v1.5 有 2,580 处确认标注错误而主结果的领先是 0.64 分。量级上说不清谁压得住谁。 那这篇到底能带走什么抛开具限有三样东西我认为是真金白银做数据管线的可以直接搬token 口径的预算换算长度修正那组公式解决「长页面 vs 短公式」的配比失真任何自回归生成任务都适用硬例归因三分类标注错 / 解码坏 / 视觉不可读 / 模型真错四者分开并且「修好标注后错误消失的样本不得进硬例过采样」——这条朴素规则能防住 hard example mining 最大的坑越抽越脏收缩估计处理小簇残差小簇的原始误差方差巨大直接拿来做采样决策会让预算被几个偶然簇吃掉向池化均值收缩后再比较稳得多。至于模型本身2B/4B 权重已经在 HuggingFace 上开放文档解析有刚需的团队值得拉下来在自己语料上试一把——尤其如果你的输入天然偏脏手机拍照、老扫描件、翻拍屏摄这正是它相对优势最大的区间。往大里说这篇论文讲的其实是一个特别古老的道理当所有人都往模型上堆创新的时候把数据的账算清楚可能就是最便宜的那次涨分。90 时代拼的是数据工程质量这句听起来像正确的废话——但 WeVisDoc 至少把这本账的算法明明白白写出来了。
返回列表