ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Gaze-supported Large Language Model Framework for Bi-directional Human-Robot Interaction

Gaze-supported Large Language Model Framework for Bi-directional Human-Robot Interaction 一、文章主要内容和创新点1. 主要内容本文提出了一种基于注视(gaze)和语音的大型语言模型(LLM)框架,用于双向人机交互(HRI)。该框架旨在解决现有HRI系统在协作任务中缺乏动态适应性、多模态上下文感知能力的问题,具体内容包括:框架设计:通过多视觉输入感知工作环境,结合用户的注视追踪和语音交互,实现对动态用户任务的实时支持;采用模块化设计,可迁移至不同任务和机器人,且基于语言的交互状态表示和快速机载感知模块确保了实时性。开发过程:通过多次公开传播活动收集反馈,提升了系统的鲁棒性和用户体验。实验验证:在实验室研究中,将该框架与传统脚本式HRI流程进行对比,发现基于LLM的方法在适应性、用户参与度和任务执行指标上略有提升,但可能产生冗余输出;而脚本式流程更适合简单任务。2. 创新点多模态融合:首次将注视追踪、语音交互与多视觉3D环境感知深度融合,通过LLM实现上下文感知的双向交互。模块化与可迁移性:框架设计支持快速适配不同机器人和任务,减少任务特定修改或重新编程的需求。推理机制:采用思维链(Chain-of-Thought, CoT)推理机制,结合GPT-4o-mini模型,实现动态任务分解(从高层语言描述到低层机器人动作)。
返回列表