
All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts作者Xingsong Ye, Yongkun Du, Jiaxin Zhang, Zhixian Li, Chong Sun, Chen Li, Jing Lyu, Lianwen Jin, Zhineng Chen核心发表机构Fudan University、Shanghai Key Laboratory of Multimodal Embodied AI、Tencent Inc.、South China University of Technology论文链接arXiv:2609.24058v1发布于arXiv 预印本cs.CV|—|—|—|—|—|—|—|—|—|—|—|| CRNN | 42.77 | 55.47 | 64.00 | 63.87 | 44.28 | 70.10 | 82.38 | 30.93 | 53.13 | 48.60 | 55.55 || ABINet | 61.06 | 69.47 | 82.15 | 79.90 | 58.08 | 81.74 | 88.84 | 50.76 | 53.20 | 73.88 | 69.91 || SVTR | 64.68 | 75.83 | 83.38 | 81.42 | 60.44 | 83.95 | 90.06 | 52.75 | 58.80 | 78.65 | 73.00 || SVTRv2 | 70.85 | 83.46 | 93.23 | 84.73 | 66.67 | 85.86 | 91.52 | 47.91 | 66.27 | 85.39 | 77.59 || PARSeq | 67.87 | 78.12 | 87.08 | 83.21 | 65.15 | 84.98 | 90.81 | 61.01 | 62.67 | 84.55 | 76.55 || MAERec | 76.17 | 80.15 | 92.92 | 86.01 | 68.35 | 86.16 | 92.13 | 52.66 | 63.73 | 86.80 | 78.51 || SVTRv2-AR | 75.11 | 87.79 | 94.15 | 87.28 | 69.36 | 85.86 | 92.27 | 59.30 | 69.60 | 86.80 | 80.75 ||ScriptMoE|78.09|88.30|95.38| 86.77 |71.21|87.19| 91.67 |61.20|72.00|88.76|82.06|论文强调增益集中在多语言识别中最困难的低资源文字系统上相对 SVTRv2-ARArabic 提升 2.98 个百分点78.09 vs 75.11、Thai 提升 2.40 个百分点72.00 vs 69.60、Tibetan 提升 1.96 个百分点88.76 vs 86.80。同时也存在个别文字上的代价Hindi 略低 0.51 个百分点86.77 vs 87.28Latin 低 0.60 个百分点91.67 vs 92.27也低于 MAERec 的 92.13。这印证了论文提到的跨文字权衡优化总体准确率必然牺牲个别文字上的峰值性能。与通用系统的对比差距更为悬殊源码片段中可见的 VLM 结果里Qwen3.5-9B 平均 63.77%、PP-OCRv5 MLT 在其支持的文字上平均 63.59%、HunyuanOCR 56.68%、PaddleOCR-VL 51.73%、GLM-OCR 34.16%、InternVL3.5-8B 24.94%、GOT-OCR 2.0 18.47%、DeepSeek-OCR2 8.61%若干方法在 Arabic、Bangla、Tibetan 上几乎完全失效。作者据此论断覆盖广 ≠ 准确而 ScriptMoE 相对这些系统高出约 18 个百分点。需要说明的是源码片段只包含了主表的部分行完整表格中其余约 15 个 STR 模型与 9 个通用 OCR 系统包括 PP-OCRv6、HunyuanOCR 之外的其他条目的完整数值未在给定材料中出现。效率方面ScriptMoE 每张图激活 41.13M / 45.85M 参数激活比例 89.69%比基于 VLM 的系统少一到两个数量级。在单张 V100、batch size 256 的条件下ScriptMoE 的推理延迟为 541.07 ms、吞吐 473.1 img/s、显存占用 2091.0 MB作为对比SVTRv2-AR 为 395.92 ms / 646.6 img/s / 2057.3 MBMAERec 为 1297.63 ms / 197.3 img/s / 2411.3 MBCRNN 虽然只有 57.40 ms / 4459.9 img/s 但精度远低。也就是说ScriptMoE 比沉重的自回归方法与 MAERec 明显更快、更省内存但比它所替换的 SVTRv2-AR 更慢、更大——这是用一定推理开销换取多语言精度的权衡。端到端多语言 OCR 结果进一步说明了识别器的增益如何传导到部署系统。在 CC-OCR 多语言任务上保持 PP-OCRv5 检测器不变、仅把识别器替换为 ScriptMoE总体 F1 从 65.71% 提升到80.89%绝对提升 15.18 个百分点这一结果略微超过最强零样本通用 VLM Qwen3.5-9B80.73%也明显超过最佳 OCR 专用 VLM Qianfan-OCR76.70%与专家系统 GoogleOCR71.78%。分语言看替换后的 Korean 为 92.33、Japanese 89.43、Russian 79.22、Arabic 87.45相比 PP-OCRv5 MLT 的 78.58 / 76.13 / 49.67 / 81.93 提升尤为明显。由于检测器完全相同这一提升完全归因于识别环节说明更强的文字感知识别器可以直接转化为更强的端到端 OCR 系统。一个重要限定是CC-OCR 任务只评论文本识别、不评检测框端到端分数仍受上游 PP-OCRv5 检测器上限约束漏检与误检在严格词级评测的拉丁文字上最为明显。在单语基准上 ScriptMoE 同样没有退化。在中文 BCTR 上ScriptMoE 平均 86.85%Document 99.47 / Handwriting 74.79 / Scene 83.35 / Web 89.80相比 SVTRv2-AR 的 85.93% 提升 0.92 个百分点在英文 Union14M-Benchmark 上平均 88.95%Curve 93.49 / Multi-Oriented 96.71 / Artistic 81.78 / Contextless 87.55 / Salient 89.10 / Multi-Words 89.87 / General 84.15相比 SVTRv2-AR 的 88.67% 提升 0.28 个百分点。这说明多语言的增益来自脚本特化本身而不是在高资源文字系统上做了牺牲式交换。定性比较也支持同样的结论图中比较了 ScriptMoE 与若干代表性 VLM 及多语言 OCR 系统在 TextMuSS-Bench 上的预测与 ground truth 不同的字符被标红Null表示模型不支持该语言ScriptMoE 持续产生正确结果而竞争方法经常无法保证准确的多语言识别。路由分析验证了专家特化的真实存在。对每个脚本组取一行代表性文本可视化路由器对各专家的 softmax 以及路由专家与共享专家的有效混合后发现四个来自不同脚本组的样本各自被其预期专家主导而不是被任意划分。这说明路由器学到的确实是脚本 → 专家的对应关系辅助分类信号的引导达到了预期效果。)4.3 消融实验 / Ablation Study消融实验围绕默认配置λ scls 0.1 \lambda_{\text{scls}}0.1λscls0.1、shared-expert width ratio 0.5 0.50.5、router jitterσ 0.05 \sigma0.05σ0.05每次只变化一个超参数。数据消融Tab. data_ablation在 MLT2019 的 7 种文字上计算 AvgArabic、Bangla、Chinese、Hindi、Japanese、Korean、LatinRussian/Thai/Tibetan 单独列出DataArabicBanglaChineseHindiJapaneseKoreanLatinAvg(7)RussianThaiTibetanSynthMLT53.6823.1546.3720.3437.9874.1079.9847.940.000.000.00Real only73.4076.3491.0879.3958.2568.9292.4777.120.000.000.00Synth only60.0083.2191.0882.4467.8585.7186.9579.6168.1370.3087.08Synth Real78.0988.3095.3886.7771.2187.1991.6785.5261.2072.0088.76四条结论很清晰。第一只用真实数据训练会在从未见过的三种低资源文字上完全崩溃Russian/Thai/Tibetan 均为 0.00证实合成数据对这些文字是必需的。第二仅用 TextMuSS-10M 训练已远超原有合成数据 SynthMLTMLT2019 平均 79.61 vs 47.94甚至在 MLT2019 平均上超过真实数据 2.49 个百分点79.61 vs 77.12且在 Russian/Thai/Tibetan 上从 0 提升到 68.13 / 70.30 / 87.08说明纯合成规模本身就能带来可观收益。第三合成与真实结合产生互补MLT2019 平均比 real-only 提升 8.40 个百分点85.52 vs 77.12。第四出现一个有意思的此消彼长模式加入合成数据会让 Latin 下降92.47 → 91.67加入真实数据会让 Russian 下降68.13 → 61.20。原因在于 Latin 与 Cyrillic 存在视觉上完全相同、却映射到不同字符的同形字homoglyph造成跨文字系统混淆ScriptMoE 相对其他 STR 方法缓解了这种混淆但难以完全消除因为 Latin 有丰富的真实数据而 Cyrillic 只能依赖合成替代品。上图给出了这一问题的具体案例一张俄语文本图像中与拉丁字母视觉相同的西里尔字符偶尔被误识别为拉丁同形字最终产生拼写看似合理、但文字系统归属错误的转写结果。模型消融Tab. ablation_full中#Experts0表示无 MoE 的纯自回归基线列为专家数、Top-k、路由粒度、是否使用L scls \mathcal{L}_{\text{scls}}Lscls、是否使用共享专家以及十种文字的准确率与均值#ExpertsTopRoutingL scls \mathcal{L}_{\text{scls}}LsclsSharedAvg0////80.7522image✓✓81.5242image✓✓82.06102image✓✓81.3241image✓✓81.6044image✓✓81.9442token✓✓81.6942image—✓81.6342image✓—81.35由此可归纳出若干结论。MoE 解码器不可或缺无专家的纯 AR 基线除在数据最丰富的 Latin 上92.27外全面落后于 MoE 系列说明单一稠密解码器无法充分服务十种文字系统。专家数量存在最优点4 个专家取得最佳均值 82.06%增益集中在最受益于专用容量的文字相对 AR 基线Thai 2.40、Chinese 1.23扩展到 10 个专家即每个文字系统一个反而把增益抹平降到 81.32原因是每个专家看到的样本过少、难以充分特化而某些文字系统更适合与结构近邻共享专家——例如 Chinese/Japanese/Korean 共享笔画拓扑。稀疏度上 Top-2 是正确的选择Top-181.60虽仍优于无 MoE 基线但单个路由专家无法捕获相关文字间共享的子模式在 Thai 与 Chinese 上掉分最多Top-481.94在均值上几乎追平 Top-2却每张图激活更多参数、回报可忽略且在 Japanese 与 Korean 上反而变差说明过度激活的边际收益递减。路由粒度基本是平局token 级路由在某些文字上换取边际收益如 Hindi在另一些文字上几乎等量损失如 Russian差异在噪声范围内因此保留开销更低的图像级路由。两个 script-aware 组件都有效移除脚本分类信号后路由器会漂离文字系统边界平均损失 0.43%82.06 → 81.63移除共享专家伤害更大平均损失 0.71%82.06 → 81.35且下降集中在低资源文字Arabic −3.62、Tibetan −3.65。超参数消融进一步细化了默认值的合理性。脚本分类损失权重λ scls \lambda_{\text{scls}}λscls取 0.0 / 0.1 / 0.2 / 0.5 时均值分别为 81.63 /82.06/ 81.44 / 81.35说明移除该损失会让 router 漂离脚本边界过度加权又会让辅助目标变成竞争目标、过度约束路由器低资源 Tibetan 受打击最大在 0.5 时降至 84.55温和正则优于硬脚本先验。共享专家宽度比取 0.0 / 0.5 / 1.0 时均值为 81.35 /82.06/ 81.41移除共享专家是最有害的设置而 0.5 已恢复接近全部收益继续放大无益。Router jitterσ \sigmaσ取 0.0 / 0.05 / 0.1 时均值为 81.61 /82.06/ 81.32说明小的乘性抖动能正则化图像级路由器、避免路由脆弱过大则注入过多噪声。五、相关工作 / Related Work与专家 OCR 系统的区别。传统专家系统通常为每种语言部署一个识别器并依赖语言识别步骤把裁剪图路由到对应模型本文则用单一 all-in-one 模型共享视觉编码器、由 MoE 解码器按图路由到 Top-2 脚本专家从而避免误差累积、降低训练与部署成本、简化维护。与 VLM 的区别。VLM 参数量大、推理成本高、边缘部署困难而且在多个文字系统上仍然不准确。ScriptMoE 是轻量专用识别器在 TextMuSS-Bench 与 CC-OCR 上达到或超过 VLM 水平参数量却少一到两个数量级每图激活 41.13M。在 CC-OCR 上最佳零样本 VLM Qwen3.5-9B 为 80.73 F1而 ScriptMoE 为 80.89OCR 专用 VLM 中最佳的 Qianfan-OCR 为 76.70KOSMOS2.536.23、GOT-OCR 2.024.95、DeepSeek-OCR32.50、MinerU2.543.20、PaddleOCR-VL45.50差距更大专家系统 GoogleOCR 为 71.78、PP-OCRv5 MLT 为 65.71。与 MRN / IMLTR 的区别。MRN 为每种语言维护独立特征提取器、激活语言特定专家和独立字符分类器参数量随语言数线性增长ScriptMoE 共享一个视觉编码器专家与脚本簇对齐采用 Top-2 路由加 always-on 共享专家以及图像级路由参数量不随语言数线性增长。与 Multiplexed TextSpotter 的区别。后者做词级脚本识别把每个词路由到特定脚本的识别头ScriptMoE 则做图像级路由每张图只进行一次路由决策所有输出 token 共享同一组专家避免 token 级路由抖动并降低路由成本。与 SARN 的区别。SARN 向识别器注入脚本信息以使字符特征更具判别性ScriptMoE 通过辅助四路分类头提供脚本感知监督但不直接用脚本标签选择专家路由器仍保留划分文字系统内部子群体的自由。与非自回归NAR/自回归AR方法的关系。AR 方法显式建模语言精度领先但逐 token 解码较慢NAR 方法CTC 或并行解码速度快但语言先验弱在多语言与形态丰富文字系统Hindi、Tibetan上退化严重不适合联合多文字系统识别。而直接复用 AR 模型会让所有文字系统争抢一份稠密解码器参数、造成高低资源不平衡。ScriptMoE 保留 AR 骨干但把解码器容量重新分配为脚本感知只激活当前文字系统所需的专家参数。与 CLI-STR 的发现。CLI-STR 指出决定多语言性能的是数据规模而非语言相似性这直接激励了本文为低资源文字系统构建大规模合成数据 TextMuSS-10M。与原有合成数据集 SynthMLT 相比TextMuSS-10M 在 MLT2019 平均上高出 31.67 个百分点79.61 vs 47.94并让 Russian/Thai/Tibetan 从 0 提升到 68.13 / 70.30 / 87.08。六、局限性与展望 / Limitations Future Work论文明确列出三点局限。第一是合成数据与真实图像之间的域差距尽管 TextMuSS-10M 经过精心合成仍与真实世界图像存在分布差异论文提出收集大规模真实多语言场景图像并用于半监督学习是缩小该差距的有前景方向。第二是 Latin–Cyrillic 同形字混淆与拉丁字母视觉相同的西里尔字符偶尔会被误识别为拉丁同形字产生拼写看似合理却文字系统归属错误的转写全合成数据的实验显示更均衡的数据分布能有效缓解这一问题但要彻底关闭差距仍需构建真实的西里尔文字数据。第三是端到端流程依赖上游检测器当前复用 PP-OCRv5 检测器其多语言检测质量无法在所有文字系统上得到保证可能限制整体性能。除论文明确指出的内容外从源码与实验设置中还可以观察到若干值得关注的事实。其一是TextMuSS-Bench 各文字系统的样本量高度不均衡Latin 有 5,885 张而 Chinese 仅 325 张、Bangla 393 张、Tibetan 356 张宏平均虽然做了平衡但单个文字系统上的估计方差可能较大。其二是低资源文字的标注风险新增的俄语、泰语、藏语由各自语言的一位专家转写复核者不专精这些低资源语言只在形态学层面做一致性检查标注噪声难以完全排除。其三是专家数量不能无限扩张10 专家每文字系统一个的实验显示每专家样本过少、无法特化反而抹平增益这意味着继续增加文字系统时需要重新思考专家划分策略而不能简单地每新增一种文字就新增一个专家。其四是脚本分组与专家角色是人工定义的虽然论文为不支持的语系预留了归入路径视觉上类似字母归入 Alphabet、汉字形式归入 CJK、从右到左归入 Arabic 家族、其余归入 Others但扩展到新文字系统时分组方案可能仍需人工重新设计。其五是推理速度模型仍使用贪心自回归解码541.07 ms / 473.1 img/s 虽优于 MAERec1297.63 ms / 197.3 img/s但慢于 SVTRv2-AR395.92 ms / 646.6 img/s与 NAR 方法。其六是端到端验证仅限 CC-OCR 一个任务泛化性有待更多基准检验。在展望上论文提出两条未来工作方向一是探索持续学习continual learning策略使新增文字系统无需重训整个模型即可被纳入二是把 ScriptMoE 与更强的文本检测器结合进一步提升端到端多语言 OCR 性能。七、总结 / Conclusion这篇论文针对多语言场景文本识别中数据稀缺与单模型难以服务多种文字系统两重困难提出了一条位于 per-language 专家系统与大规模 VLM 之间的中间路线。在数据侧论文构建了覆盖 10 种文字系统、229 种语言的大规模多语言合成场景文本数据集 TextMuSS-10M以 40%/20%/20%/20% 的文本来源混合、针对不同文字系统的渲染调整CJK 更高垂直文本比例、阿拉伯文 RTL 渲染和 8k 背景图为真实数据稀缺的文字系统提供均衡且充分的训练信号同时组装了覆盖全部十种文字的真实场景文本基准 TextMuSS-Bench。在模型侧论文提出 ScriptMoE保持共享的 SVTRv2 视觉编码器把解码器的 FFN 替换为 script-aware MoE 块通过图像级 router 激活 Top-2 个与文字系统对齐的专家来重新分配解码器容量用始终激活的共享专家维持跨文字迁移用轻量四路脚本分类信号λ scls 0.1 \lambda_{\text{scls}}0.1λscls0.1温和引导专家特化并以可学习的 per-token gate 融合两路输出。消融实验逐一确认了这些设计选择的必要性4 个专家、Top-2 稀疏度、图像级路由粒度、脚本分类信号与共享专家缺一不可其中共享专家是最不能省的组件。实验结果显示ScriptMoE 在 TextMuSS-Bench 上取得 82.06% 的平均准确率比最强 STR 基线 SVTRv2-AR 高 1.31 个百分点增益集中在 Arabic、Thai、Tibetan 等最困难的低资源文字系统上在 CC-OCR 端到端多语言任务上仅替换 PP-OCRv5 的识别器就把 F1 从 65.71% 提升到 80.89%略超最佳 VLM 的 80.73%而每图仅激活 41.13M / 45.85M 参数在 BCTR 与 Union14M-Benchmark 两个单语基准上也并未退化。总体而言这项工作说明以文字系统而非语言为单位组织模型容量、并配合大规模均衡合成数据可以在保持轻量的前提下让单一识别器在广泛文字系统上同时获得接近专门化模型的精度与远低于 VLM 的成本而剩余的主要挑战集中在合成与真实之间的域差距、Latin–Cyrillic 同形字混淆以及上游检测器带来的端到端上限。原文摘要:Multilingual scene text recognition (STR) remains challenging due to the scarcity of training data for most languages and the difficulty of serving diverse scripts within a single model. Existing solutions either deploy one recognizer per language, inflating cost and introducing error accumulation, or rely on massive vision-language models (VLMs) that are expensive and still inaccurate on many scripts. In this work, we pursue an all-in-one multilingual recognizer that is simpler than per-language experts, lighter than VLMs, and more accurate than both. First, we construct TextMuSS-10M, a large-scale synthetic scene text dataset spanning 10 scripts and 229 languages. It provides balanced and sufficient supervision where real data is unavailable. Second, we propose ScriptMoE, a script-aware Mixture-of-Experts (MoE) architecture. It shares a single visual encoder and replaces the dense decoder with a sparse MoE block, which consists of an image-level router dispatches each image to the top-2 script-aligned experts and a shared expert absorbs cross-script knowledge. Extensive experiments on our assembled TextMuSS-Bench (10 scripts, 10,899 images) show that ScriptMoE achieves the highest accuracy of 82.06%, outperforming the strongest STR baseline by 1.31%. On the CC-OCR end-to-end multilingual task, replacing only the recognizer in PP-OCRv5 with ScriptMoE lifts F1 score from 65.71% to 80.89%, slightly surpassing the best VLM (80.73%) at a fraction of the parameter count.PDF链接:https://arxiv.org/pdf/2609.24058v1部分平台可能图片显示异常请以我的博客内容为准