
整体架构分为pre-training 和 post-training两个阶段。注意后训练阶段不是像RL微调那样两个阶段是必须的。两个阶段都是在训练模型没有微调。因为“知识隔离” action expert 在pre-training中不训练只在post-training中训练。pre-training连续动作会通过 FAST tokenizer 转换成离散 token然后 VLM 像预测文字一样预测这些动作 token。这一路径的优点是可以使用标准语言模型的 next-token prediction训练速度快动作序列经过压缩后更短可以和文本、视觉问答、机器人指令等任务共同训练。但缺点是推理时需要逐个 token 自回归生成动作序列越长推理延迟越高。因此 FAST 更适合训练不一定适合实时低层控制。损失:预训练 PaliGemma FAST token prediction 两部分组成post-training 以VLM 产生的多模态隐藏表示为条件生成动作后训练阶段同时优化 FAST/text loss Flow matching loss后训练PaliGemma FAST token predictionaction expert flow matching即 Action Expert 的输入由三部分组成VLM 的条件表示组成共享的 prefix contex加噪的连续动作块Flow matching 时间步 τ把时间步 τ 经过一个 MLP 和正弦位置编码然后注入 action expert 的各层。快慢思考双系统System 2 使用 PaliGemma/VLM 的语言和视觉理解能力将复杂任务拆解成简单子任务System 1 使用同一 VLM 提供的多模态表示并通过 Flow Matching Action Expert 生成连续动作System 2 的子任务会作为 System 1 的语言条件作为输入。注意fast-token不直接和action expert交互数据。VLM 的条件给action expert作为条件其实最后实际是self-attention交互后训练仍然更新FAST/text lossvla模块只是只阻断 action expert 的梯度回传。权重冻结通常在微调中VLM 的参数完全不更新、参数冻结。无论梯度来自 FAST loss、文本 loss 还是 flow loss最终都不会修改 VLM 权重