ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

字节:PRISM提升多模态指令遵循

字节:PRISM提升多模态指令遵循

📖标题:PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
🌐来源:arXiv, 2608.05249v1

🛎️文章简介
🔸研究问题:如何让多模态大模型有效理解并执行包含多重优先级规则的复杂指令,而非仅回答单一问题?
🔸主要贡献:论文提出PRISM数据合成框架及评估协议,通过结构化评分标准监督显著提升模型对多规则、优先级感知指令的理解能力。

📝重点思路
🔸定义评分标准理解任务:将模型角色从生成者转变为执行者,输入图像和结构化、带优先级的评分标准,要求模型逐条验证规则并给出总体判断。
🔸构建PRISM四阶段数据合成流水线:首先基于图像意图发现人物角色与任务;其次利用前缀引导生成包含感知、推理等五类及三种优先级的规则集;接着通过多维质量评估筛选高质量数据;最后生成包含视觉 grounding、逐条验证及聚合结论的结构化响应轨迹。
🔸设计无裁判评估协议PRISM-Eval:引入宽松和严格两种准确率指标,通过确定性匹配固定标签进行评估,无需在推理时调用外部裁判模型,确保评估的高效性与客观性。

🔎分析总结
🔸显著提升特定能力:仅在1万条合成数据上进行微调,Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%大幅提升至30.1%,且该增益可迁移至不同架构的其他开源模型。
🔸保持通用性能:在提升评分标准理解能力的同时,模型在MMBench、OCRBench等14个通用基准测试上的平均性能保持不变甚至略有提升,证明该方法未损害通用能力。
🔸关键组件有效性:消融实验表明,移除优先级标注会导致严格准确率大幅下降,证明语义优先级结构至关重要;而移除结构化思维链则影响通用基准表现,说明两者互补。
🔸超越推理时策略:相比零样本或顺序查询等无需训练的推理策略,PRISM通过训练内化验证过程,在单轮调用中实现了更高的准确率和效率。

💡个人观点
论文设计了一个规则验证任务,迫使模型学习如何作为执行者去解析和内化复杂规则。

返回列表