ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RoboReact:基于生成式第一人称视频的机器人技能蒸馏与全身操控

RoboReact:基于生成式第一人称视频的机器人技能蒸馏与全身操控 1. 从“看”到“做”为什么机器人需要第一人称视频来学习想象一下你第一次学习打网球。教练可能会给你看一段慢动作分解视频讲解挥拍的角度和步伐。但真正让你学会的是无数次自己站在球场上感受球拍的重量、球撞击拍面的震动、以及为了接一个刁钻的球而不得不做出的全身协调动作。这个过程本质上就是“具身学习”——你的身体本体在环境中通过感知和行动来获取技能。对于机器人尤其是人形机器人要实现同样复杂的全身操控任务我们面临的核心挑战是如何让机器人获得这种“具身”的、可泛化的技能传统的机器人技能学习无论是基于模型的规划还是模仿学习往往依赖于大量精心设计的仿真环境或昂贵的真人演示数据。这些方法存在明显的瓶颈仿真环境难以穷尽真实世界的物理复杂性比如不同材质的摩擦系数、物体的微小形变而真人演示数据不仅采集成本极高且难以覆盖所有可能的任务变体和意外情况。更重要的是这些方法通常将任务分解为孤立的子技能如“抓取”、“放置”缺乏对任务整体流程和动态环境变化的连贯理解。这就引出了RoboReact这个工作背后的核心洞察利用生成式的第一人称Egocentric视频作为“虚拟教练”通过“智能体技能蒸馏”的方式让机器人学会像人一样观察、思考和反应。这里的“生成式”是关键。我们不再需要去真实世界拍摄海量的第一人称视频而是可以利用现有的文本-图像-视频生成模型如Sora、Stable Video Diffusion等根据任务描述批量生成以机器人视角或类人视角观看的任务执行视频。这些视频里“虚拟人”会完成从打开冰箱门、取出饮料、到避开障碍物、拧开瓶盖等一系列连贯动作。那么为什么是第一人称视角因为这与机器人自身的传感器配置通常是头部的摄像头最为匹配提供了最直接的空间和动作参考。视频中呈现的视觉流变化直接对应着执行动作带来的环境反馈。通过分析这些视频序列机器人可以学习到任务执行的“视觉-动作”关联模式而不仅仅是最终的动作轨迹。这就是“技能蒸馏”的过程从一个能够生成丰富行为策略的“教师”模型即视频生成模型视频理解模型中提炼出适用于机器人本体的、可执行的策略。最终目标“可泛化的全身操控”则点明了这项技术的野心。它不满足于让机器人学会一两个固定动作而是希望机器人具备应对新物体、新环境布局、甚至突发干扰比如在搬运时物体突然滑动的能力。这要求学习到的策略必须具备高度的适应性和鲁棒性能够根据实时感知信息做出全身协调的调整——也就是标题中的“React”反应。这不再是按部就班的回放而是真正的智能反应。2. RoboReact技术框架拆解三步走实现技能迁移理解了核心理念我们来看看RoboReact具体是如何实现的。整个流程可以清晰地划分为三个核心阶段构成了一个从虚拟世界到实体机器人的完整技能迁移管道。2.1 第一阶段生成高质量的第一人称任务视频这是所有后续工作的基石。目标是根据一个简单的文本提示例如“一个机器人打开橱柜门从架子上取下一盒麦片然后放在餐桌上”生成一段以执行者视角拍摄的、物理合理的视频。技术选型与挑战目前最前沿的视频生成模型如Sora、Runway Gen-2、Stable Video Diffusion已经能够生成相当逼真和连贯的视频。但对于机器人学习我们有几个额外的、苛刻的要求视角一致性视频必须严格保持第一人称视角不能有镜头切换或第三人称镜头。这需要在生成时通过强有力的视角控制来实现。物理合理性视频中的物体运动必须符合牛顿力学。物体不能穿模手与物体的交互要看起来有力且合理物体的运动轨迹要自然。这通常需要模型隐式地学习到物理规律或者与物理引擎进行某种形式的结合。任务完整性生成的视频需要完整展示从初始状态到目标状态的整个任务流程包括可能出现的中间步骤如调整抓握姿势、避开障碍等。实操中的关键点在实际操作中我们往往不会只生成一个视频。对于同一个任务提示我们会生成数十甚至上百个变体视频。这些变体可能体现在环境布局差异橱柜门把手的位置、麦片盒的摆放角度、餐桌的距离。执行风格差异“虚拟人”可能用左手开门也可能用右手抓取麦片盒时可能从顶部抓也可能从侧面抓。意外情况模拟在视频生成阶段我们甚至可以主动注入一些“干扰”比如让麦片盒在抓取时轻微滑动或者橱柜门带有阻尼铰链需要用力拉开。这么做的目的是为了构建一个丰富多样的“视觉技能库”让后续的蒸馏过程能够学习到任务的核心模式而不是某个特定实例的过拟合。2.2 第二阶段从视频到可执行策略的蒸馏有了视频下一步是如何让机器人“看懂”并“学会”视频里的技能。这就是“Agentic Skill Distillation”的核心环节。这里的“Agentic”智能体化指的是我们不是让机器人机械地模仿视频里的像素运动而是让它学会视频中“智能体”的决策逻辑。技术实现路径这个过程通常涉及一个两阶段的模型视频理解模型教师模型这是一个经过训练的神经网络它的任务是观看一段第一人称视频并理解其中隐含的动作意图和状态变化。例如当视频中手伸向门把手时模型应能理解这是“预抓取”阶段当手开始旋转时对应“拧开”动作。更高级的模型甚至可以预测出下一帧可能的最佳动作是什么。这个模型通常在大规模的人类视频数据集如Ego4D, Something-Something上进行预训练具备了强大的时空理解能力。策略蒸馏我们将机器人本体的观测空间通常是其摄像头看到的图像、关节角度、力传感器读数等与视频理解模型的输出进行对齐。具体来说我们训练一个机器人本体的策略网络学生模型。在训练时我们给策略网络输入当前机器人的观测同时将对应时间点的生成视频帧输入给视频理解模型。视频理解模型会输出一个“动作建议”或“价值判断”。策略网络的学习目标就是让自己的输出机器人的动作尽可能与视频理解模型的“建议”相匹配或者让自己的决策能获得视频理解模型的高“价值”评分。一个生动的类比这就像一位足球教练通过比赛录像指导球员。教练视频理解模型指着录像说“看这个时候对方后卫重心在左你应该果断向右变向突破。”球员机器人策略网络在训练中反复观看这个片段并结合自己实际踢球时的感觉本体观测去理解“对方重心左移”在自己视角下是什么样的视觉特征以及“向右变向”这个动作自己应该如何用双腿去执行。最终球员学会的不是录像里那个特定球员的跑动轨迹而是“阅读防守并选择突破方向”的决策能力。2.3 第三阶段仿真到实物的适应与全身操控执行蒸馏得到的策略最初是在仿真环境中进行训练和验证的。仿真是理想的试错场可以快速进行数百万次试验而不用担心损坏昂贵的实体机器人。仿真环境搭建我们需要一个高保真的物理仿真器如Isaac Gym、MuJoCo或PyBullet。仿真环境需要精确建模机器人本体包括质量、惯性、关节限位、电机模型、被操作物体形状、质量、摩擦系数以及环境桌面、橱柜的铰链力学。将蒸馏得到的策略网络接入仿真环境输入是仿真渲染出的第一人称视角图像和本体状态输出是各个关节的目标扭矩或位置。全身操控的挑战“Whole-Body Manipulation”意味着机器人需要协调手臂、躯干、甚至腿部的动作来完成一个任务。例如要打开一个沉重的冰箱门可能不仅需要手臂用力还需要身体后倾以提供反作用力甚至需要脚底调整姿态以保持平衡。这就要求策略网络必须具备全身协调控制的能力。在训练时我们需要在奖励函数中充分考虑平衡性、能耗、动作平滑度等多个目标。通常这会采用分层强化学习或基于优化的控制方法与蒸馏得到的高层策略相结合。仿真到实物的跨越这是机器人学习永远的难题。仿真中的物理参数如摩擦、阻尼与实物总有差异。为了应对这个问题RoboReact类方法通常会采用域随机化技术。即在仿真训练时随机化各种物理参数物体质量、表面摩擦、电机增益、视觉纹理等让策略学会在不确定的环境中保持鲁棒。当策略在千变万化的仿真环境中都能成功时它适应真实世界未知差异的能力就大大增强了。最后将训练好的策略部署到实体人形机器人上。机器人通过自身的摄像头获取实时视觉观测输入策略网络网络输出关节控制指令驱动机器人完成从“看”到“做”的闭环。3. 核心组件深度剖析视觉编码、动作表征与训练技巧要让RoboReact这套流程高效运转几个核心组件的设计至关重要。它们直接决定了技能蒸馏的效率和最终策略的性能。3.1 视觉观测的编码从像素到语义机器人摄像头捕捉到的原始RGB图像是高维且包含大量冗余信息的。直接将其输入策略网络效率低下且难以训练。因此我们需要一个强大的视觉编码器来提取关键特征。常见方案对比编码器类型原理优点缺点适用场景卷积神经网络通过多层卷积和池化提取局部到全局的视觉特征。技术成熟在图像分类、检测上经过充分验证计算效率相对较高。对长距离空间关系建模能力较弱特征偏向表观纹理对几何和物理属性编码不足。对物体识别、场景分类要求高的任务。Vision Transformer将图像切分为块通过自注意力机制建立所有图像块之间的关系。全局建模能力强能更好地理解场景中不同部分的相关性可扩展性好。计算量较大需要大量数据预训练对图像块的划分可能破坏局部结构。需要理解复杂场景布局、物体间关系的任务。预训练基础模型使用在超大规模数据集如LAION上预训练的模型如CLIP的视觉编码器、DINOv2。拥有强大的通用视觉表征能力包含丰富的语义和几何信息迁移效果好。模型庞大推理速度可能较慢特征可能过于通用需要针对机器人任务进行微调。RoboReact的推荐选择能最好地理解生成视频中的复杂内容。在RoboReact的语境下使用基于ViT或类似架构的、经过对比学习预训练的基础模型作为视觉编码器是当前的最优解。因为它从海量互联网图像中学到的特征能够很好地理解生成视频中出现的各种常见物体和场景为后续的策略学习提供了一个丰富且稠密的语义特征空间。注意在实际部署时我们通常会对这个预训练编码器进行轻量级的微调或者在其特征之上添加一个小的适配器网络让特征更专注于与动作决策相关的信息例如物体的可操作部位、自身的末端执行器状态等。3.2 动作空间的表征如何让机器人“动”得合理策略网络输出的动作需要转换成机器人底层控制器的指令。如何设计这个动作表征直接影响学习的难度和动作的质量。离散 vs. 连续对于人形机器人复杂的全身操控动作空间毫无疑问是连续的关节角度、速度、扭矩。我们通常输出关节的目标位置或目标扭矩。绝对坐标 vs. 相对增量绝对坐标直接输出每个关节的绝对角度。这种方式简单直接但策略很难学习因为相同的物体位置可能对应完全不同的绝对关节角度组合即机器人姿态有多解问题。相对增量输出相对于上一时刻关节角度的变化量Δθ。这是更常用的方式它让策略学习“如何调整当前姿态”更符合控制逻辑也更容易学习平滑的动作。末端执行器控制 vs. 关节空间控制关节空间控制直接输出所有关节的命令。自由度DoF高能实现非常灵活的姿势但学习难度极大容易产生不自然或自碰撞的动作。末端执行器控制策略网络只输出末端执行器如手在三维空间中的目标位置和姿态共6维。然后由一个逆向运动学求解器计算出实现该位姿所需的各关节角度。这种方式极大地降低了策略学习的维度并且通过IK求解器保证了动作的合理性和可达性。对于RoboReact这类以物体操作为重点的任务末端执行器控制是更主流和实用的选择。全身协调的扩展对于真正的全身操控动作空间需要包含基座躯干的运动。这可以扩展为输出基座的线速度和角速度移动底盘或者骨盆的位置和朝向固定基座人形。策略需要同时协调手臂和身体的动作这是一个更大的挑战通常需要在奖励函数中精心设计平衡项和能耗项。3.3 训练策略与技巧稳定学习的关键即使有了好的视频、好的编码器训练一个能输出稳定、合理动作的策略网络仍然充满挑战。以下是一些关键的训练技巧1. 课程学习不要一开始就让机器人学习“打开装满物品的冰箱门并取出饮料”这样复杂的任务。我们可以设计一个课程阶段一学习在无障碍物情况下将手移动到固定位置。阶段二学习抓取一个固定位置的方块。阶段三学习将方块放入一个指定位置。阶段四结合视觉从随机位置抓取方块并放置。阶段五学习开门等带有约束的交互动作。…最终阶段组合所有技能完成复杂长周期任务。 课程学习通过分解难度极大地提高了训练的成功率和稳定性。2. 奖励函数设计奖励函数是引导策略学习的“指挥棒”。在技能蒸馏中除了与教师模型视频理解模型的输出对齐这个主要奖励外我们还需要一系列辅助奖励来塑造行为任务进度奖励基于当前状态与目标状态的差异如物体与目标位置的距离给予奖励。动作平滑性惩罚对相邻时间步动作的巨大变化进行惩罚鼓励平滑运动。能量消耗惩罚对关节扭矩或速度的平方和进行惩罚鼓励高效省力的动作。平衡惩罚对于人形机器人计算压力中心与支撑多边形的距离防止摔倒。安全惩罚对自碰撞、关节超限、与环境发生剧烈碰撞进行严厉惩罚。3. 离线强化学习与行为克隆的结合生成的第一人称视频本质上是一个离线数据集它包含了状态视频帧和隐含的动作帧间变化。我们可以先用行为克隆的方法让策略网络直接学习从状态到动作的映射这是一个有效的预热。然后可以引入离线强化学习算法如Conservative Q-Learning, IQL利用这个数据集学习一个价值函数从而对策略进行微调使其不仅模仿还能优化长期回报。4. 数据增强与域随机化对输入图像进行随机裁剪、颜色抖动、添加噪声等可以提升策略的视觉鲁棒性。在仿真中进行的域随机化随机化物理参数、视觉外观则是应对仿真到实物差异的核心手段。4. 实战中的挑战与应对策略理论很美好但把RoboReact这套思路落地到真实的机器人项目上你会遇到一系列教科书上不会写的坑。下面分享几个我从实际研究和工程化尝试中总结出的关键挑战和应对策略。4.1 生成视频的质量与真实性鸿沟这是最前端的也是影响最深远的挑战。当前视频生成模型虽然进步神速但生成的视频在物理细节上经常“露馅”。典型问题物体运动违反物理规律例如一个被推的箱子会突然加速或毫无摩擦力地滑动液体倾倒时没有连贯的流动形态。交互细节模糊手“抓”住物体时手指的弯曲和受力形变不真实看起来像是粘在一起的。视角突变虽然要求第一人称但生成过程中可能出现微小的、不连续的视角跳动破坏视觉流的一致性。应对策略后处理与筛选建立一套自动化的视频质量评估管道。除了人工检查可以使用预训练的物理合理性评估模型、动作平滑度检测算法对生成的视频进行打分和过滤。只保留得分最高的前20%-30%用于蒸馏。混合数据源不要完全依赖生成视频。可以引入少量真实世界采集的第一人称操作视频如来自Ego4D数据集的部分片段作为“锚点”数据。在训练时将真实视频和生成视频混合使用有助于将策略拉向更真实的物理动态。以“提示工程”换取质量在给视频生成模型写提示词时要极其详细。例如不要只写“打开抽屉”而是写“以第一人称视角展示一只右手缓慢而稳定地握住厨房木质抽屉的圆形金属把手手臂肌肉有轻微的紧张感将抽屉沿着滑轨平稳地拉出发出轻微的摩擦声整个过程保持视角稳定”。详细的描述能引导模型生成更符合物理和细节的视频。4.2 “视觉-动作”关联的模糊性与多义性这是蒸馏过程中的核心难题。视频中的一帧画面可能对应着多种合理的下一步动作。例如视频中手靠近一个杯子它可能是要去抓杯柄也可能是去推杯子或者只是路过。这种多义性会导致策略学习的目标不清晰产生混淆。应对策略引入时序上下文不要让策略网络只基于当前单帧图像做决策。应该将过去若干帧的历史视觉特征和动作序列也作为输入。这相当于给了策略一个“短期记忆”让它能根据之前的动作意图来理解当前帧的上下文从而消解多义性。通常使用LSTM或Transformer来建模这时序依赖。使用更强大的“教师”不要只用视频理解模型做简单的动作分类或预测。可以采用基于扩散模型的策略提取方法或者使用能够预测“动作可能性分布”的模型作为教师。这样学生策略学到的是一个在给定状态下“哪些动作是好的”的概率分布而不是一个单一的最优动作容错性更强。分层策略设计将策略分为高层和底层。高层策略基于视频蒸馏负责输出抽象的“技能意图”或“子目标”如“移动到抓取位姿”、“施加旋转力”。底层策略则是一个通用的、可能通过其他方式如强化学习训练的运动控制器负责将抽象指令转化为具体的关节运动。这样视频蒸馏只负责高层的、语义更明确的规划降低了对细节动作模仿的要求。4.3 仿真与现实的动力学差异即使经过了充分的域随机化仿真中训练的策略在真实机器人上首次运行时表现也常常会大幅下降。这是因为我们无法对所有现实中的动力学特性如电机 backlash、线缆的阻力、复合材料的柔性进行完美建模和随机化。应对策略系统辨识与仿真校准在实物机器人上进行一系列标准动作如正弦波运动、阶跃响应记录其实际运动数据。然后在仿真中调整机器人的动力学参数如阻尼、摩擦系数、电机响应延迟使仿真机器人的运动数据与实物尽可能匹配。这是一个迭代且必要的过程。在线自适应在策略网络的基础上增加一个在线自适应模块。这个模块实时监测机器人的执行误差如期望关节角度与实际角度的偏差、末端执行器的定位误差并动态地微调策略网络的输出或者调整底层控制器的参数。这相当于给机器人装上一个“即时微调”的反射弧。在环学习这是最直接但成本最高的方法。将仿真中训练好的策略部署到实物上在安全约束下如力控、碰撞检测进行实际操作。收集实物运行的数据成功和失败的用这些真实数据对策略网络进行微调fine-tuning。即使是少量真实数据也能显著提升策略的适应性。4.4 长周期任务中的误差累积与恢复复杂任务由一系列子动作串联而成。前一个动作的微小偏差可能导致机器人进入一个完全未见过或不利的状态使得后续基于视频学习的策略完全失效。例如抓取时位置偏了一点导致物体在手中不稳后续的放置动作就无法按计划进行。应对策略状态重置与课程学习在训练时不要总是在理想初始状态下开始。可以随机地将机器人的状态设置为任务链中某个中间状态并带有一定的噪声如物体位置偏移、机器人姿态微调。强制策略学习如何从“错误”的状态中恢复并继续完成任务。学习重规划策略除了主任务策略可以额外训练一个“恢复策略”或“重规划策略”。当监测到当前状态与预期轨迹偏差过大时例如通过一个预训练的状态异常检测器触发这个恢复策略。它的目标是将系统带回到一个已知的、正常的子任务起点然后主策略再接管。引入符号化的状态表示除了原始的视觉和本体感知人为定义一些高层符号状态如“物体是否被抓牢”、“门是否已打开到30度以上”。策略网络可以同时利用这些符号状态进行决策。这些符号状态通常更鲁棒能提供更强的任务进度信号帮助策略在出现低级误差时进行高层纠偏。5. 未来展望超越模仿走向创造与协作RoboReact所代表的“从生成视频中蒸馏技能”范式为机器人学习打开了一扇新的大门。它极大地降低了对昂贵真实演示数据的依赖并利用互联网规模的知识体现在预训练生成模型上来赋能机器人。展望未来这项技术有几个令人兴奋的演进方向。从技能模仿到技能创造目前的范式主要是“模仿”生成视频中已有的技能。下一步是让机器人具备技能组合与创造的能力。例如给机器人看一个“用锤子敲钉子”和一个“用勺子搅拌”的视频它能否理解“工具”和“作用对象”的概念从而在面对“用扳手拧螺丝”这个新任务时自主组合出正确的技能这需要模型具备更深层的物理功能和因果推理能力。未来的系统可能会结合大型语言模型将文本指令、视频演示和物理常识融合生成全新的、合理的动作序列。从单任务到通用操作基础模型现在的RoboReact针对每个任务或任务簇都需要生成视频和蒸馏策略。终极目标是训练一个通用操作基础模型。这个模型在超大规模、多样化的生成视频涵盖家庭、工厂、户外等无数场景和任务上进行预训练学习到一个通用的“视觉-动作”对应关系。对于任何新的具体任务只需要少量示例或一段文本描述该模型就能通过提示学习或微调快速适应并生成控制策略。这将使机器人像ChatGPT处理语言一样处理物理操作任务。从单机操作到人机协同第一人称视频天生包含了与环境和他人交互的视角。未来的技能蒸馏可以专注于人机协作任务。例如从生成的双人协作视频如一人递工具另一人接住并使用中蒸馏出机器人作为协作伙伴的策略。机器人需要理解人类的意图、预测人类的动作并做出适时、安全的反应。这需要模型具备更强的社会智能和意图识别能力。从视觉主导到多模态融合当前方法严重依赖视觉。但真实操作中触觉、力觉、听觉信息至关重要。例如拧瓶盖时需要感知扭矩摆放易碎品时需要轻柔的触觉反馈。未来的框架需要融合多模态生成数据如结合视觉与力觉信号的模拟数据进行蒸馏让机器人学会“感觉”世界而不仅仅是“看”世界。伦理与安全考量随着这项技术的发展我们必须前瞻性地思考其伦理与安全边界。由生成模型创造的技能可能包含不安全或不符合伦理的动作。因此在蒸馏过程中必须嵌入价值对齐和安全约束。例如通过人工反馈强化学习让策略不仅学习“如何做”还学习“什么不该做”或者在策略输出层加入硬性的安全过滤器防止危险动作的产生。这条路充满挑战但RoboReact已经为我们指明了一个极具潜力的方向将虚拟世界无限的知识与创造力安全、有效地灌注到实体机器人的“身体”里让它们真正成为我们物理世界的智能助手。
返回列表