
HOID-R1研究总结与核心内容翻译一、文章主要内容总结本文聚焦人机交互检测(HOI)领域的开放世界泛化问题,提出了名为HOID-R1的检测框架,旨在解决现有方法依赖大型语言模型文本提示却忽视3D空间理解能力、在新场景(新动词、未见过的物体或交互组合)中泛化性能差的缺陷。1. 研究背景与现有问题HOI检测的重要性:作为AR/VR、机器人技术等领域的关键应用,HOI检测需定位视觉场景中的人与物体,并刻画二者交互的语义和功能关系,是以人为中心的AI技术的基础。现有方法局限:传统HOI检测方法多局限于小规模封闭集基准,仅在固定交互类别上训练和评估,分布外泛化能力弱;近年基于提示的开放词汇HOI检测方法仅利用语言先验,忽视模型推理能力,对查询表述敏感,难以区分细粒度或模糊交互。2. HOID-R1框架核心设计HOID-R1以强化学习(RL)为范式,整合思维链(CoT)引导的监督微调(SFT)与组相对策略优化(GRPO),具体包含三阶段核心流程:监督微调(SFT)阶段:通过精心设计的演示数据,引导模型严格遵循〈主体、动词、物体〉三元组等输出格式,并引入认知思维链(CoT)提示(用``标签标注逐步推理过程),在保证输出结构化