
模型架构1、Π模型采用了预训练的VLM骨干模型结合了包含多任务的跨体数据集。2、添加了独立的动作专家通过流匹配生成连续动作从而实现精准连续的操作技能。流匹配是连续生成模型属于扩散模型的变体π₀用它来生成机器人连续动作序列。3、为了实现对各类多样化机器人数据源的利用采用了跨 embodiment 训练即将多种机器人类型的数据整合到同一模型中。4、精心设计的训练方案即先让模型在规模庞大、内容多样的语料库上进行预训练再在更细分、经过精心筛选的数据上进行微调以诱导出期望的行为模式。训练方式1、首先进行预训练使用了大规模的混合数据集不同机器人、不同任务其目的是训练一个具备广泛能力和泛化性的基础模型。2、针对复杂灵巧任务采用了两种后训练方式一是利用小到中等规模数据的高效后训练二是针对叠衣服、移动操作等复杂任务采用大规模数据集的高质量后训练。3、对数据内容进行的处理将机器人的关节角度状态q与预测动作设置为训练过程中维度最大的机器人一致实验中是18维机器人关节角度和预测动作的维度是相同的理论上机器人有多少关节就应预测多少个关节的动作。对于配置和空间维度低于18维度的机器人对训练数据进行0填充同样对于图像数量少于三个的机器人对缺失的图像进行掩码mask处理。掩码mask与空白图像的区别如果使用空白图像模型会将空白图像作为信息纳入注意力计算使用mask则直接屏蔽掉这个图像token不影响模型的注意力以及计算损失。为什么不对动作也进行mask?而是进行补零ai的回答是动作属于整个token不同的维度数据属于token内部的形态如果对token内部mask模型会学习到错误的输入输出维度导致损失计算时发生错误但是为了避免模型学习到维度数据为0的地方在计算loss的时候将这部分mask掉不参与计算。数据形式1、对输入模型的数据分布进行建模1机器人观测得到的多张RGB图像2文本语言3关节角度向量。其中图像与关节角度向量首先通过对应编码器进行编码再经过线性投影层映射到与语言标记相同的嵌入空间中。2、动作专家训练通过流匹配进行训练训练中得到50个未来动作块代表50HZ一秒的连续轨迹。