
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09Octo详解开放策略如何把多机器人经验变成可微调的通用底座导读OctoAn Open-Source Generalist Robot Policy要回答的问题是机器人策略能不能像视觉或语言模型一样先在多种机器人、多种任务上预训练再用少量目标域数据迁移到新的平台。论文发布了一个完整开放的通用机器人策略模型、训练代码、数据处理流程和检查点都可获得。它使用 Open X-Embodiment 中筛选出的 25 个数据集、约 80 万条轨迹进行训练并在 9 个机器人设置上评估。Octo 的关键不只是“把数据集做大”而是把不同机器人的输入和输出都拆成可插拔 token。语言指令、目标图像、多个相机和本体感知信息先进入各自 tokenizer再由同一个 Transformer 处理新增传感器或动作空间时只需增加轻量编码器、位置嵌入或 action head就能在下游微调而不必重训整个骨干。动作端使用条件扩散头预测动作片段使策略可以表达多峰、连续的操作分布。实验显示Octo 在预训练分布内可直接控制多种机器人在每个新领域约 100 条示范的条件下微调平均成功率达到 72%高于从头训练和 VC-1 视觉表征基线。它的价值由此落在一个很实际的接口上预训练阶段吸收跨机器人经验部署阶段允许用户更换观察和动作定义。猫先生认为Octo 最值得关注的不是“通用”这个标签而是它把通用性落实成了可替换的输入 token、readout token 和输出 head。机器人形态无法统一时接口的可扩展性比强行寻找一个固定动作空间更重要。论文标题Octo: An Open-Source Generalist Robot Policy论文地址https://arxiv.org/abs/2405.12213项目主页https://octo-models.github.ioGitHubhttps://github.com/octo-models/octo原文脉络论文按照“为什么需要通用策略—Octo 如何设计—跨平台实验—设计选择消融—讨论与未来工作”的顺序展开。前两节说明单机器人、单任务策略的数据成本和泛化边界第三节把灵活 token 接口、跨数据集训练和扩散动作头组合起来第四节分别验证零样本控制、数据高效微调以及架构、数据、目标函数和模型规模的影响。1-2. 背景与相关工作机器人策略为何需要开放接口传统机器人学习通常为一台机器人和一个任务单独采集示范策略输入、相机配置和动作空间在训练时就被固定。跨机器人数据可以增加经验覆盖但不同平台的摄像头、自由度、控制频率和动作定义并不一致直接拼接数据往往会把模型锁死在某一种接口上。此前的 RT-X、RoboCat 等工作证明多机器人预训练有价值但通常限制了下游输入或缺少方便的微调方案。Octo 的定位更接近一个可复用的策略初始化它不承诺一个模型零样本解决所有新任务而是让预训练骨干能够在新传感器、新动作空间和新机器人形态上继续学习。3. Octo 模型把策略接口拆成 token3.1 统一的输入 token 与 Transformer 骨干Octo 将任务定义和观测序列写成统一 token 序列。语言指令经过预训练的 T5-base 编码目标图像和相机图像经过轻量卷积网络后切成 patch token本体状态等结构化信号则由对应的小型 tokenizer 映射到相同维度。序列大致可以写成T [ T T , T o , 1 , T o , 2 , … , T o , H ] p , \mathcal{T}\left[\mathcal{T}_{T},\mathcal{T}_{o,1},\mathcal{T}_{o,2},\ldots,\mathcal{T}_{o,H}\right]p,T[TT,To,1,To,2,…,To,H]p,其中T T \mathcal{T}_{T}TT是语言或目标图像等任务 tokenT o , t \mathcal{T}_{o,t}To,t是第t tt个时刻的观测 tokenp pp是可学习位置嵌入。图 1Octo 以 80 万条 Open X-Embodiment 轨迹预训练同时支持语言或目标图像指令并可微调到新的观察和动作空间。来源论文 Figure 1。Transformer 使用 block-wise attention。当前观测只能访问任务 token 以及当前和过去的观测避免未来信息泄漏数据集中不存在的输入通道则整体 mask。这样带语言和不带语言、单相机和多相机的数据都可以共用同一骨干。3.2 Readout token 与可插拔输出头每个时刻插入一个 learned readout token。它可以读取此前的任务和观测表示却不会反向影响这些 token作用类似 BERT 的[CLS]把到当前时刻为止的上下文压缩成动作解码器需要的向量。新增动作空间时保留 Transformer 参数只增加新的 readout 位置嵌入和输出 head。图 2模型架构与 block-wise attention。虚线模块表示微调时可以新增的传感器或动作输出主干参数无需重新初始化。来源论文 Figure 1Model architecture。猫先生认为Octo 的工程关键是“主干稳定、接口可换”。它没有假设所有机器人都能被压成统一关节向量而是把差异留在输入 tokenizer 和输出 head让共享表示承担跨任务迁移。3.3 扩散动作头预测连续的动作片段Readout embedding 进入轻量条件扩散头。模型从高斯噪声x K x^KxK开始经过K KK次去噪得到一段连续动作而 Transformer 只需前向一次x k − 1 α ( x k − γ ϵ θ ( x k , e , k ) N ( 0 , σ 2 I ) ) . x^{k-1}\alpha\left(x^k-\gamma\epsilon_{\theta}(x^k,e,k)\mathcal{N}(0,\sigma^2I)\right).xk−1α(xk−γϵθ(xk,e,k)N(0,σ2I)).训练时对专家动作加入噪声再让ϵ θ \epsilon_\thetaϵθ恢复原动作。动作以 chunk 形式预测能够覆盖多个连续控制步并通过扩散分布表达同一观察下可能存在的多种合理行为。论文的消融显示扩散头比 MSE 动作头或离散化动作分布更适合跨数据集的行为多样性。3.4 训练数据与开放实现Octo 从 Open X-Embodiment 中筛选 25 个包含图像、末端执行器动作且行为较多样的数据集形成约 80 万条轨迹的训练混合。数据预处理会移除没有图像流、分辨率过低或过于重复的数据更丰富的数据集提高采样权重缺失的相机通道用零填充夹爪动作也被对齐到统一语义。模型提供 27M 和 93M 参数两个检查点并开放预训练与微调代码。图 325 个训练数据集在每个 batch 中的采样组成。数据混合同时考虑数据量、行为多样性和重复样本问题。来源论文 Figure 2。4. 实验设置与结果零样本控制和少样本微调4.1 九个机器人设置覆盖不同迁移难点实验覆盖 4 个机构的 9 个真实机器人设置既包括预训练分布中的平台也包括需要新输入、新动作空间或新形态的目标域。评测任务包含长时序操作、精确插入、双臂协作和不同物体交互。图 4九个机器人设置及典型任务。评测同时考察预训练分布内控制和新域微调。来源论文 Figure 3。4.2 零样本目标图像提供更强的任务约束在预训练数据覆盖的环境中Octo 可直接接受自然语言任务并控制多种机器人。与 35M 参数的 RT-1-X 相比平均成功率高出约 29%在 WidowX 和 RT-1 Robot 上其表现与参数量 55B 的 RT-2-X 相近。Octo 还支持目标图像条件在 WidowX 任务上目标图像条件比语言条件高约 25%说明目标状态的视觉描述能减少语言歧义。零样本能力并不等于任意新任务都能执行。新物体通常保持较高成功率但换场景会下降翻转或精确插入等新行为下降更明显这正是微调接口存在的原因。4.3 约 100 条示范即可迁移到新域六个目标域各使用约 100 条示范、统一微调超参数和 20 次试验。Octo 微调成功率分别为 Berkeley Insertion 70%、Stanford Coffee 75%、CMU Baking 50%、Berkeley Pick-Up 60%、Berkeley Coke 100%、Berkeley Bimanual 80%平均 72%。从头训练基线平均 20%VC-1 视觉表征基线平均 15%。这些任务还刻意加入新条件Insertion 增加力矩传感器Pick-Up 和 Bimanual 切换到关节位置控制Coke 和 Bimanual 使用新的机器人形态。Octo 的收益因此不仅来自视觉特征迁移也来自可扩展的观察与动作接口。4.4 设计消融数据规模、灵活性与动作分布同样重要消融围绕四组变量展开。架构方面允许更灵活输入输出的 token 化设计优于固定输入布局数据方面更宽的数据混合通常优于只使用单一数据集目标函数方面扩散动作头优于 MSE 和离散动作头模型规模方面93M 参数模型通常优于 27M但收益取决于数据覆盖和微调设置。图 5论文对不同机器人设置和设计选择的比较结果体现 Octo 在零样本控制与微调中的整体优势。来源论文 Figure 4 及相关实验。猫先生认为实验最有说服力的地方不是单个最高成功率而是同一套微调配方能够跨越传感器、控制方式和机器人形态变化。它把“通用策略”从展示型 demo 推进成了可迁移的工程起点。5. 讨论、局限与可复现性Octo 的开放性覆盖检查点、训练代码、数据处理、微调脚本和监控工具这降低了复现实验和继续训练的门槛。但开放策略仍受数据混合质量制约不同数据集的动作语义、相机分布和任务难度并不完全一致零填充和夹爪对齐只能解决接口层问题不能消除数据偏差。模型在预训练分布外的全新技能、长时序规划和高精度接触操作上仍需要目标域数据。93M 参数规模也不意味着可以忽略真实机器人采集、控制延迟和安全约束。后续工作需要更系统地研究数据权重、跨形态动作表示以及如何让微调不破坏原有通用能力。总结开放策略的核心是可迁移接口Octo 的技术路线可以收束为三点用大规模跨机器人轨迹获得通用初始化用 tokenizer、block-wise attention 和 readout token 保持观察与动作接口可替换用条件扩散头表达连续、多峰的动作片段。结果表明在已有经验覆盖的任务上可以直接控制多种机器人在新传感器、新动作空间和新形态上也能用约 100 条示范完成有效微调。它并没有消除机器人数据和真实部署的成本但把每个新任务从“重新训练一个策略”变成“接入接口并微调一个开放底座”。这正是 Octo 对后续通用机器人模型最实际的贡献。参考资料Octo: An Open-Source Generalist Robot PolicyOcto 官方项目主页Octo GitHub推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列