ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【arXiv 2026】世界行动模型即零样本策略|从视频扩散世界模型视角

【arXiv 2026】世界行动模型即零样本策略|从视频扩散世界模型视角

摘要

本文解读 arXiv 2026 论文《World Action Models are Zero-shot Policies》。该论文提出DreamZero——一个 14B 参数的世界行动模型(WAM),通过融合预训练视频扩散骨干 Wan2.1flow matching 联合去噪自回归分块生成,让机器人在异构非重复数据上同时学习未来帧预测与动作生成,其特别之处在于视频作为世界演化的稠密表示直接决定动作,天然继承物理动力学先验。实验表明零样本泛化 2 倍以上超越最先进 VLA(AgiBot unseen 任务 39.5% vs 16.3%),仅需 10–20 分钟视频即可跨本体迁移(相对提升 42%+),并经 38× 推理加速实现 7Hz 实时闭环控制,为具身智能基础模型提供了"从预测世界到直接行动"的重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机:为什么 VLA 学不会"怎么做"?
  • 研究主线:从问题到结论
  • 基准/方法设计:什么是世界行动模型?
  • 分类全景:机器人策略学习的三大路线
  • 方法细节:自回归分块扩散与闭环 KV 缓存
  • 实验设计与结果:零样本泛化如何验证?
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • DreamZero 是什么?
    • WAM 与 VLA 有什么区别?
    • 为什么视频数据能跨本体迁移?
    • DreamZero 训练需要多少数据?
    • 7Hz 实时控制是怎么实现的?
    • DreamZero 的主要局限是什么?
  • 参考链接

论文基本信息

项目内容
标题(英文)World Action Models are Zero-shot Policies
标题(中文)世界行动模型即零样本策略
作者Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi ``Jim'' Fan, Joel Jang
机构NVIDIA GEAR Lab
会议arXiv 2026
arXivhttps://arxiv.org/abs/2602.15922
项目网站https://dreamzero0.github.io

背景与动机:为什么 VLA 学不会"怎么做"?

核心矛盾:现有 Vision-Language-Action(VLA)模型(如 RT-2、OpenVLA、GR00T N1.6、$\pi_{0.5}$)具备强大的语义泛化(理解"这是什么、任务是什么"),但缺乏物理运动泛化(不知道"手该怎么动、物体会怎么倒")。原因在于它们学习的是"观测→动作"的直接映射,而动作监督信号稀疏、重复示范成本高,物理动力学先验只能从有限的动作标注中隐式习得。

关键差异:DreamZero 属于 World Action Model(WAM)家族——学习"视频+动作"的联合分布,动作由预测的视觉未来隐含决定。与视频模型机器人策略(UniPi、RoboDreamer、DreamGen——视频生成指导动作,动作仍需逆动力学模型提取)不同,WAM 把视频预测与动作生成端到端联合建模,天然继承网络级视频数据中的物理动力学先验。

WAM 的历史演进(附录 H):从 2020–2023 的潜空间世界模型(Dreamer、V-JEPA,需测试时规划/搜索),到 2024–2025 的生成式视频世界模型(UniSim、Genie、DreamGen,动作仍需逆动力学提取),再到 2026 年 2 月 DreamZero 首次实现视频+动作联合端到端建模,14B 模型实时 7Hz 控制;2026 年 3–7 月 GigaWorld、MotuBrain、Wall-WM、ABot-M0.5 等 1B–14B 多模态变体相继涌现,WAM 家族全面爆发。

为何 WAM 对机器人基础模型至关重要:一是物理先验复用——网络级视频数据蕴含动力学,动作学习只需逆映射;二是数据宽容度——异构非重复数据即有效,采集成本数量级下降;三是跨本体通道——视频是本体无关表示,人类视频可直接迁移到机器人。

研究主线:从问题到结论

图 9:研究主线 Mermaid 流程图:从纯动作模仿缺乏物理泛化的问题出发,经视频物理先验动机、WAM 联合设计、自回归分块方法,到 2 倍超越 VLA 的实验与结论

基准/方法设计:什么是世界行动模型?

DreamZero 的核心设计是端到端联合建模视频与动作:单模型同时输出未来视频帧与动作序列,覆盖 AgiBot G1 双臂移动机器人与 Franka 单臂(DROID)两个本体。它基于预训练视频扩散骨干 Wan2.1(14B DiT),冻结文本/图像编码器与 VAE,仅训练 DiT 块与新增的状态/动作编解码器——视频生成质量即策略上限,视频预测扮演隐式视觉规划器,动作从"看得见的未来"中提取。

图 1:DreamZero 总览:联合预测视频与动作,继承世界物理先验,实现异构数据学习、开放世界泛化、视频跨本体迁移与 few-shot 新本体适配

分类全景:机器人策略学习的三大路线

图 10:机器人策略学习分类树:VLA(RT-2/OpenVLA/GR00T N1.6/π0.5)、视频模型策略(UniPi/RoboDreamer/DreamGen)与 WAM 联合视频-动作(Cosmos/Genie/MIMIC),DreamZero 是 14B 端到端 WAM 代表

方法细节:自回归分块扩散与闭环 KV 缓存

联合目标:flow matching 同时去噪视频与动作隐变量,通过共享去噪时间步保证模态对齐,学习目标为 $p(\mathbf{o}{l:l+H}, \mathbf{a}{l:l+H} \mid \mathbf{o}_{0:l}, \mathbf{c}, \mathbf{q}_l)$——给定历史观测、语言指令与本体状态,联合预测未来视频帧与动作。

图 2:模型架构:视觉上下文(VAE 编码)、语言指令(文本编码器)、本体状态(状态编码器)经自回归 DiT 与 flow matching 联合预测未来视频帧与动作

自回归分块:每块 $K=2$ 个隐帧、$M=4$ 块,teacher forcing 用干净历史块条件化当前噪声块。闭环推理时执行后把真值观测注入 KV 缓存替换预测帧,消除自回归误差累积。

为何自回归优于双向:KV 缓存加速推理 3–4 倍;保留原生帧率,避免双向模型 FPS 扭曲带来的模态错位。消融(附录 B)显示 AR 与双向精度相当(均 50%),但 AR 动作更平滑且推理更快。

DreamZero-Flash:解耦视频/动作噪声调度(视频 $t \sim \mathrm{Beta}(7,1)$ 偏向高噪声),支持单步去噪,单步去噪任务进度 74% vs 朴素 52%(4 步 83%),速度提升 2.33 倍。

实时优化套件(附录 A 全景):CFG 双 GPU 并行、DiT 缓存(16→4 步)、torch.compile + CUDA Graph、kernel/scheduler 优化、NVFP4 量化,叠加 Flash 单步去噪,总延迟从 5.7s 降至 150ms,支撑 7Hz 闭环控制:

优化(累积)H100GB200
基线1.1×
+CFG 双 GPU 并行1.9×1.8×
+DiT 缓存(16→4 步)5.5×5.4×
+torch.compile + CUDA Graph8.9×10.9×
+kernel/scheduler 优化9.6×14.8×
+NVFP4 量化16.6×
+DreamZero-Flash(4→1 步)38×

实验设计与结果:零样本泛化如何验证?

评测协议:默认unseen 环境 + unseen 物体——训练与评估站点地理隔离,天然检验分布外(OOD)泛化;任务粒度 = 运动方式 × 物体类型。AgiBot 上评估 10 seen + 10 unseen 任务,DROID 上 20+20 任务。基线为 GR00T N1.6 与 $\pi_{0.5}$(各含 from-scratch / from-pretrained 两策略,相同数据与算力预算)。

图 3:AgiBot 评估设定:默认 unseen 环境与 unseen 物体,训练与评估站点地理隔离,天然检验分布外泛化

主表(零样本评估)

零样本评估DreamZero最佳预训练 VLA提升
AgiBot seen(平均进度)62.2%27.4%2.3×
AgiBot unseen39.5%16.3%2.4×
DROID unseen(进度/成功率)49% / 22.5%31% / 12.5%+18pp
跨本体 unseen(9 任务)基线+视频迁移提升
机器人→机器人(YAM,20 分钟)38.3%55.4%+44.7% 相对
人类→机器人(12 分钟)38.3%54.3%+41.8% 相对

任务/数据规模:AgiBot G1 使用约 500 小时遥操作数据,22 个真实环境,7.2K 幕(每幕约 4.4 分钟、42 个子任务);Franka(DROID)使用开源异构数据集验证可复现性。

图 4:Seen 任务评估:DreamZero 有效利用异构数据并泛化到新环境,from-scratch VLA 接近零分,预训练 VLA 仅中等表现

图 5:Unseen 任务零样本泛化:解鞋带、熨衣、画画、握手等训练外任务,DreamZero 在两个本体上均显著领先

Q1 异构数据学习:from-scratch VLA 在异构数据上几乎失败(<1%),DreamZero 达到 62.2%——视频先验弥补了动作监督的不足。消融(附录 B)显示:异构数据较重复数据 +17pp(33%→50%);模型规模 14B 较 5B +29pp(21%→50%),而 VLA 从 5B 扩到 14B 仍为 0%。

Q2 unseen 任务:AgiBot 上 39.5% vs 16.3%;DROID 上 49% vs GR00T 31% / $\pi_{0.5}$ 33%——VLAs 过度拟合 pick-and-place 主导行为,遇到训练外任务(解鞋带、熨衣、画画、握手)表现骤降。

Q3 后训练保持:任务特化微调后环境泛化不损失,fruit packing 任务显著优于 VLA。

图 6:后训练结果:WAM 在三个下游任务上匹配或超越 VLA 基线,环境泛化能力在微调后保留

Q4 跨本体视频迁移:视频是本体无关表示——仅 20 分钟 YAM 机器人视频(+44.7% 相对提升)或 12 分钟人类视频(+41.8% 相对提升)即可显著提升 unseen 任务表现。

图 7:跨本体迁移:YAM→AgiBot 与人类→AgiBot 视频-only 数据均显著提升 unseen 任务表现

Q5 few-shot 本体适配:仅 30 分钟 play 数据(55 幕)适配全新 YAM 机器人,保持语言跟随与零样本泛化。

图 8:Few-shot 本体适配:AgiBot 预训练模型用 30 分钟 play 数据适配 YAM,泛化到南瓜、泰迪熊等训练外物体

Oral 信号验证(附录 C):范式级创新有完整证据链——替换算子/表示(视频骨干替代 VLM 图文骨干):unseen 任务 2.4× 于最佳 VLA、14B vs 5B +29pp;制造监督信号(联合视频-动作 flow matching):异构数据 +17pp、from-scratch VLA 同类数据上仅 <1%;解放固定生成组件(Flash 解耦噪声调度):单步去噪 74% vs 朴素 52%(4 步 83%)、速度 2.33×。

结果对比总结

图 11:结果对比总结:DreamZero 零样本 seen 62.2% vs 27.4%(2.3×)、unseen 39.5% vs 16.3%(2.4×)、跨本体视频迁移 +44.7% 相对提升、38× 加速实现 150ms 7Hz 闭环控制

关键发现

  • 零样本泛化 2 倍以上超越最先进 VLA:AgiBot seen 任务 62.2% vs 27.4%(2.3×)、unseen 任务 39.5% vs 16.3%(2.4×);DROID unseen 进度/成功率 49%/22.5% vs 31%/12.5%(+18pp)。
  • 异构数据即可学习:from-scratch VLA 在异构非重复数据上几乎失败(<1%),DreamZero 达 62.2%;消融显示异构数据较重复数据 +17pp。
  • 规模效应显著:14B 较 5B 任务进度 +29pp(21%→50%),而 VLA 即使扩到 14B 在异构数据上仍为 0%。
  • 视频是跨本体通道:20 分钟 YAM 视频跨本体迁移 +44.7% 相对提升,12 分钟人类视频 +41.8%,视频-only 数据即可用。
  • 30 分钟 play 数据 few-shot 适配新本体:55 幕数据适配 YAM,保持语言跟随与零样本泛化,泛化到南瓜、泰迪熊等训练外物体。
  • 38× 推理加速实现 7Hz 实时闭环:CFG 并行 + DiT 缓存 + NVFP4 量化 + Flash 单步去噪,延迟从 5.7s 降至 150ms,单步去噪 74% vs 朴素 52%。

局限性

  • 算力门槛高:7Hz 实时控制需 2× GB200(38× 加速后),对比 VLA 在消费级 GPU 上可达 20Hz+,边缘部署仍远。
  • 短视界:视觉记忆仅 6.6 秒,本质是 System 1 模型,长程任务需 System 2 规划器配合。
  • 高精度任务欠拟合:亚厘米级操作(插钥匙、精细装配)表现不足,异构数据策略牺牲了稠密示范覆盖。
  • 缩放规律未明:缺少模型/数据/算力的 WAM 缩放定律,最优配置未知。
  • 作者展望:大规模第一视角人类视频(Ego4D、EgoDex 等)有望带来比 VLA 更强的迁移;更小但泛化强的视频骨干可实现边缘端 System 1 部署。

常见问题(FAQ)

DreamZero 是什么?

DreamZero 是 NVIDIA GEAR Lab 提出的 14B 世界行动模型(WAM):用预训练视频扩散模型 Wan2.1 同时预测未来帧与动作,让机器人在异构数据上学到可泛化的物理技能,实现 7Hz 实时闭环控制。

WAM 与 VLA 有什么区别?

VLA 学习"观测→动作"的直接映射,动作监督依赖大量重复示范;WAM 学习"视频+动作"联合分布,动作由预测的视觉未来隐含决定,天然继承视频数据中的物理动力学先验,因而在异构非重复数据上也能学习。

为什么视频数据能跨本体迁移?

视频是本体无关的稠密世界表示——它描述"世界如何演化"而非"某条机械臂怎么动"。因此 YAM 机器人的视频(20 分钟)甚至人类视频(12 分钟)都能迁移到 AgiBot,提升 unseen 任务表现 42% 以上。

DreamZero 训练需要多少数据?

AgiBot G1 使用约 500 小时异构遥操作数据(22 个环境、7.2K 幕);跨本体迁移只需 10–20 分钟视频示范;适配全新机器人只需 30 分钟 play 数据(55 幕),无需重复示范。

7Hz 实时控制是怎么实现的?

通过系统级优化套件:CFG 双 GPU 并行、DiT 缓存(16→4 步)、torch.compile + CUDA Graph、NVFP4 量化,加上 DreamZero-Flash 解耦噪声调度实现单步去噪,总加速 38×,延迟从 5.7s 降至 150ms。

DreamZero 的主要局限是什么?

需要 2× GB200 级算力(边缘部署远)、视觉记忆仅 6.6 秒(System 1 模型)、亚厘米级高精度任务欠拟合,且 WAM 的缩放规律尚未明确。

参考链接

  • arXiv 论文页:World Action Models are Zero-shot Policies (arXiv:2602.15922)
  • DreamZero 项目网站
  • Wan:Open and Advanced Large-Scale Video Generative Models
  • GR00T N1.6(NVIDIA)
  • π0.5: Vision-Language-Action Model(Physical Intelligence)
  • DreamGen: Unlocking Generalization in Robot Learning through Video World Models (CoRL 2025)
  • Cosmos: World Foundation Models(NVIDIA)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

返回列表