ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从300小时到3万小时,机器人到底学会了什么?世界模型GE-Act 2.0的Scaling实验

从300小时到3万小时,机器人到底学会了什么?世界模型GE-Act 2.0的Scaling实验 如果把训练数据增加 100 倍机器人会不会开始做成原先做不到的事对于具身世界模型这个问题指向一种可能大语言模型身上那条“规模增长能力随之提升”的 Scaling 路径能否在机器人身上走通。最近智元发布的原生世界—动作模型 GE-Act 2.0把这个问题变成了一组具体实验将最后一阶段的训练数据从 300 小时增加到 3 万小时观察机器人的能力怎样变化。GE-Act 2.0 尝试的路线是先预测任务执行过程中可能出现的未来视觉状态再根据这些预测生成动作。其中未来生成器和动作模型从随机初始化开始在具身操作数据上预训练。预训练完成后模型直接在新场景、新物体上接受测试不针对评测任务额外微调也不提供额外示范。团队用 100 项原子任务、20 类技能、两种机器人本体检验预训练带来的零样本操作能力。结果显示随着数据规模扩大 100 倍模型不仅原有技能更稳定还逐步解锁了此前完全无法完成的新任务包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作原生世界—动作模型的 Scaling 路径首次被系统性验证。四档训练数据量300 / 1,200 / 5,000 / 30,000 小时下的任务表现随着数据规模扩大取得非零成功率的任务增多整体成功率同步上升。项目主页及论文https://ge-act-v2.github.io/原文链接从300小时到3万小时机器人到底学会了什么世界模型GE-Act 2.0的Scaling实验01 换一个场景还能不能做检验预训练的泛化能力先看这组实验怎么测。假设机器人接下来要整理桌面我们可以先围绕桌子采集数据再针对这个任务微调。模型的成绩很可能会变好但这个结果很难说明是模型对这个环境熟悉所以执行任务变好还是它本身产生的智能带动结果变好。GE-Act 2.0 关注的是预训练结束以后换一张桌子、换一批物体机器人自己还能做到哪一步所以这组实验以真机零样本Zero-shot表现作为核心评测指标。按团队的测试设置场景、背景、光照和物体实例都没有出现在训练中模型也不为这些评测任务额外微调或接受示范。之后团队沿用同一训练配方将最后一阶段的联合训练数据设为 300、1,200、5,000 和 30,000 小时。每项任务在每种本体、每档数据规模下测试 10 次。随着数据增加三种变化逐渐清晰**能做成的任务开始变多。**取得非零成功率的任务在 G1-OP 上从 39 项增至 76 项在 G2-90D 上从 24 项增至 72 项。前面提到的折毛巾、嵌套纸杯等操作在 G1-OP 的小数据规模测试中没有成功到 3 万小时规模时出现了成功案例。整体成功率更高。G1-OP 从 17.1% 提升至 44.1%G2-90D 从 13.4% 提升至 31.1%。从 5,000 小时继续增加到 30,000 小时两种本体仍有提升说明这组实验中增加数据的收益还在持续。**数据少的本体也在受益。**G1-OP 贡献了超过 50% 的训练数据G2-90D 的占比不足 2%后者的总体成功率仍随共享数据扩大提升了 17.7 个百分点。这为通过共享训练实现跨本体迁移提供了一个积极信号。随着训练数据规模扩大两种本体的多数技能持续提升。零样本之外团队还报告了微调后的基准测试GE-Act 2.0 在 RoboTwin Hard 陌生环境测试中的成功率为 60.52%在 GenieSim 指令遵循测试中的归一化平均分为 0.770均高于 π0.5、GR00T N1.7 等参与比较的模型。02 先预测未来再生成动作这件事怎么一起学看完结果再看模型如何进行预训练。假设我们告诉机器人“把桌上的杯子拿起来。”传统动作模型会直接根据眼前的画面和这条指令决定机械臂接下来怎么动。GE-Act 2.0 在中间多加了一步先预测拿起杯子时可能出现的未来画面再让逆动力学模型IDM根据当前和未来的状态推断应该执行什么动作。世界模型预测的未来因此成为动作生成的依据。已有的 WAM 路线很多会从预训练视频生成器出发再接入动作模型。这样可以借助视频模型已经学到的生成能力。GE-Act 2.0 则面向具身操作重新设计视觉表征并从头预训练未来生成器和动作模型尝试让这几部分一起随着数据规模增长。但把它们放进同一套架构还只是开始。画面怎么表示未来怎么生成预测和动作怎么对得上都有具体问题要解决。GE-Act 2.0 架构压缩当前画面预测未来视觉状态再由逆动力学模型生成动作。原生高效表征一帧画面压缩为 24 个 token机器人既要看清物体和运动又要控制计算成本。以模型使用的 256×384 输入为例一帧就有近 10 万个像素。后面的模型还要拿着从画面里提取的信息一次次预测未来、生成动作。这份视觉表示越大训练和推理的负担也就越重。但对操作来说杯子在哪里、手在怎么移动这些信息又不能随便丢掉。GE-Act 2.0 为此设计了视觉编码器 CoAE把一帧画面压缩成 24 个视觉 token数量只有 DINOv3 的十六分之一同时保留语义、运动和局部结构信息。那么问题来了压缩以后这些信息还够不够机器人判断动作论文做了两组检查。在动作恢复测试中CoAE 的误差与 DINOv3、V-JEPA 2.1 等表征接近在基于 5,000 条 GenieSim-Instruction 操作轨迹构建的受控测试中指令—画面匹配准确率达到 97.95%为五种对照表征中最佳。也就是说模型处理的视觉 token 大幅减少了而这些测试所考察的动作信息和指令匹配能力仍然得到了保留。后面的未来预测也就有了一份更紧凑的视觉输入。原生视觉规划器让“怎么做”的误差反馈给“怎么预测”画面压缩之后下一步是把世界模型和动作模型连起来。世界模型预测拿起杯子的过程IDM 根据这些未来状态生成动作。如果生成的动作有偏差训练时就要把误差信号传回去让前面的未来预测也能跟着调整。问题出在这条训练链路的长度上。传统视频生成器往往需要多轮去噪才能生成完整的未来。动作误差要穿过这段生成过程计算和显存开销都会增加实际推理时机器人也需要等得更久。GE-Act 2.0 的做法是一步式视觉规划一次前向计算就生成规划需要的未来视觉状态。这样动作训练的误差信号也能通过预测结果反馈给世界模型。模型学习怎么行动的时候也在学习怎样预测一个更有助于行动的未来。这也带来了推理速度上的收益。据团队提供的测试数据配合紧凑的视觉表征GE-Act 2.0 在 RTX 5090 上生成一段连续动作action chunk耗时 104 毫秒。联合训练方案未来看着合理动作却可能对不上即便两个模型已经连起来训练也未必就顺了。还是拿杯子。指令只说“拿起来”没有指定用哪只手。世界模型预测的是左手抓取训练数据记录的却是右手抓取。左手可以拿右手也可以拿。两种做法分别看都说得通但如果拿右手的动作去监督左手抓取的未来画面训练信号就冲突了。GE-Act 2.0 因此引入知识对齐选择性优化KASO。它让模型先预测几个可能的未来再由动作模型判断哪一个未来和这条训练轨迹里的动作更一致选出这个结果再参与联合训练。**关键在于预测的未来能否对应上正在学习的动作。**所以 KASO 在动作空间里做比较仅仅看两张画面像不像还不足以作出选择。论文在 G2-90D 上做了陌生场景OOD的四物体抓取消融测试。使用 300 小时数据进行联合训练时相比直接端到端联合训练基线KASO 让机器人选对指令目标的比例提高了 7.5 个百分点完成抓取的成功率提高了 10 个百分点。预测与动作之间这处容易被忽略的错位最终影响的是机器人能不能把任务做好。KASO 从多个预测未来中选择与真实动作最一致的结果用于联合训练减少未来预测与动作监督的错位。03 遥操、无本体、Rollout、失败轨迹这些数据怎么用起来说到这里话题还要回到数据。机器人训练和部署过程中留下的记录往往没有那么整齐。有的视频拍下了人怎么操作却没有机器人动作标注有的轨迹记录了机器人怎么动却没有文字指令还有一些记录的就是一次失败。如果训练只接受带指令的成功示范这些数据就很难充分利用。可它们里面明明还保留着不少信息物体怎样移动手做了什么动作之后画面发生了怎样的变化。GE-Act 2.0 把这些数据安排进了三个训练阶段。**世界模型先看视频学习环境会怎样变化。**这个阶段使用 3.9 万小时“指令—视频”数据其中包含 3,000 小时无本体数据也就是没有机器人动作标注的第一视角与人类操作视频。视频能呈现操作过程因此即使缺少动作标注也可以用来预训练世界模型。**IDM 从轨迹里学画面这样变机器人做了什么**这个阶段使用 3.2 万小时带动作记录的机器人轨迹其中包含 2,000 小时失败操作与部署回流rollout数据。IDM 根据操作前后的画面预测动作再用实际动作记录作监督。只要这些对应关系还在就不要求轨迹额外带有文字指令或成功标签。**再用完整数据把预测未来和生成动作连起来。**最后使用 3 万小时“指令—视频—动作”数据联合训练让世界模型和 IDM 一起优化。前面从 300 小时到 3 万小时的 Scaling 实验改变的就是这一阶段的数据量。这三个阶段的数据池存在重叠小时数不能直接相加。但它们说明了一件事不同完整程度的数据可以分别用来学习不同的能力。失败轨迹的价值也就好理解了。比如一次抓取没有完成机器人执行了哪些动作、画面随之发生了什么变化仍然被记录了下来。IDM 可以继续从这些对应关系里学习。任务失败了这段经历里仍然有可用的信息。对于持续产生部署数据的团队这也是一个很实际的方向让机器人每次执行留下的记录有更多机会进入下一轮训练。分阶段预训练04 写在最后再回到开头那个问题数据从 300 小时增加到 3 万小时机器人会多学会些什么GE-Act 2.0 给出的结果是能做成的任务变多了整体成功率提高了数据占比少的本体也出现了明显进步。而在这组结果背后视觉表征、未来预测、动作生成和数据利用都需要为同一件事配合起来让机器人学到的东西最终能够用到操作上。
返回列表