
机器人动手前要不要先在脑子里演一遍未来2026 年 10 月 7 日斯坦福开源了 OpenWAM一个把视频预测与动作生成装进同一架构的世界-动作模型框架。它要回答的是机器人领域吵了很多年的一道选择题动手之前要不要先在脑子里演一遍未来。视觉语言动作模型只会看到什么做什么预测未来是它们的盲区。纯世界模型只会预测下一帧画面把它变成机械臂指令是它们的盲区。OpenWAM 把两条路线放进同一条流水线用注意力掩码做出四种可插拔的组合程序。论文挂在 arXiv 2610.07922作者名单里有李飞飞和吴佳俊。四条路线共享同一视频骨干与同一训练目标只有生成顺序和注意力关系不同。这是第一次有人把先看再动先动再看这类路线之争放到可复现的统一实验台上比较。两派之争为什么吵不出结果先看再动的代表是视觉语言动作模型里的主流做法。OpenVLA、GR00T 这类模型把相机画面和任务指令直接映射成动作。它们的优势是闭环控制直接训练配方成熟。它们的问题是不会推演遇到没见过的状态只能硬着头皮猜。先动再看的代表是世界模型流派它们先学会预测未来帧。预测未来对规划有用但世界模型本身不知道动作该怎么出。把两者拼起来就是世界-动作模型这两年突然热了起来。各家世界-动作模型用不同骨干、不同数据集、不同训练配方结果根本没法比。一篇论文说自己的路线好另一篇说自己的路线好谁也说服不了谁。OpenWAM 的野心就是给这场混战提供一个共同地基。四种交互程序只有注意力掩码不同共同地基的第一步是定义四种交互程序VTA、ATV、Joint、Decoupled。VTA 先预测视频再根据预测出的视频生成动作。ATV 先生成动作再根据动作预测视频。Joint 同时去噪视频与动作未来 token 之间双向注视。Decoupled 最反直觉视频与动作的未来 token 互不注视各自独立生成。四种程序跑在同一个骨干上tokenization、训练目标、下游配方全部一致。差异只在注意力掩码谁看谁、谁先生成、谁的条件干净谁的条件带噪。所有程序都用 latent flow matching 训练。每 4 帧视频 latent 对齐一个 16 步动作块本体感知按块注入。VTA 与 ATV 的第二阶段在训练时学习真实轨迹推理时用第一阶段预测当条件。每种程序都接收任务指令与已观测历史只是内部生成顺序不同。掩码图把未来视频与未来动作标成不同的生成轮次。干净的观测是白色带噪的预测目标是蓝色。打开掩码图一眼就能看出四种路线在注意力上到底差在哪。这套设计让生成顺序第一次成为可实验的变量而不是各家的口头主张。后面所有实测数字都是这四种程序在同一地基上跑出来的。混合 Transformer视频与动作各配一个专家骨架之外OpenWAM 还有一个架构决定视频与动作各自配一个专家。视频专家 5B 参数来自 Wan2.2-5B 的宽度适配拷贝。动作专家 2B 参数是单独训练的轻量模型。两个专家组成混合 Transformer简称 MoT。各自保留独立的归一化、投影与前馈层。注意力层跨专家共享视频 token 与动作 token 打包进同一条序列。任务文本通过各自的交叉注意力进入。这个设计比共享 DiT 更贵一点但实测值回票价。在 LIBERO-Long 上MoT 比共享 DiT 高出 5.0 分对应 VTA。同样的对比Joint 高出 3.0 分。预训练账本334 万条轨迹与 14 天 B200四个程序共享的视觉底座来自一次针对机器人视频的预训练。起点是 Wan2.2-5B 通用视频模型OpenWAM 把它往机器人动作数据上掰。预训练语料有 334 万条轨迹合计 1.46 万小时源视频。数据横跨真实与合成的机器人操作、人类引导操作、人类交互。这一阶段只用视频不碰动作标签与本体感知。因果注意力让视频可以分块生成每块只用当前与过去的观测。预训练在 32 张 NVIDIA B200 上跑了 14 天。产出是全框架共享的视觉底座也是下游所有实验的起点。数据集轨迹/片段小时Open X-Embodiment1,300,7491,911.29AgiBot World Beta1,003,6722,976.4Ego-Exo4D v25,035221.26InternData-A1637,4987,433.91RoboCOIN183,1571,306.83RoboMIND107,877305.5FastUMI-100K92,823461.77UMI family5,43024.60最大的两块是 Open X-Embodiment 的 130 万轨迹与 AgiBot World Beta 的 100 万轨迹。合成数据 InternData-A1 占了时长的大头7433 小时。这份视频底座值不值看消融就知道机器人视频预训练把 VTA 从 68.4 拉到 97.8。同样的底座Joint 从 62.2 拉到 96.6。而随机初始化的视频专家VTA 只有 20.0 分Joint 只有 27.2 分。通用视频模型加机器人视频预训练是这套成绩的根基。LIBERO 实测四种程序与十一个基线主战场是 LIBERO 四套件Object、Goal、Spatial、Long。每个种子每套件 500 次闭环评测50 个任务样本各 10 次。VTA 平均 98.6%四个套件全部超过 97%。ATV 平均 96.8%Joint 平均 97.6%Decoupled 平均 98.0%。对比基线里OpenVLA 只有 76.5%π0 是 94.1%。方法ObjectGoalSpatialLong平均OpenVLA88.479.284.753.776.5OpenVLA-OFT98.497.997.694.597.1π098.895.896.885.294.1π0.598.298.098.892.496.9GR00T-N197.693.094.490.693.9Motus99.896.696.897.697.7Fast-WAM100.097.098.295.297.6LingBot-VA99.697.298.598.598.5OpenWAM-VTA99.498.498.697.898.6OpenWAM-ATV98.097.296.695.496.8OpenWAM-Joint98.297.897.696.697.6OpenWAM-Decoupled99.098.097.897.098.0最意外的结论藏在 Decoupled 与 Joint 的对比里。在 LIBERO-Long 上Decoupled 拿到 97.0%Joint 只有 96.6%。未来视频与未来动作完全不互相注视居然不输给双向注视。说明强控制并不要求视频与动作的未来 token 互相打照面。注意力掩码的影响在短套件上同样被高基线压得很平。OpenWAM 四种程序内部榜首与榜尾只差 1.8 分。全部方法里有七种都超过了 97%。这套对比第一次让生成顺序成为被定量比较的变量。结论是顺序重要但没有哪条路线通吃所有任务。VTA 在 Object 上 99.4%在 Spatial 上 98.6%。组合顺序的选择应该跟着任务走而不是跟着信仰走。反事实数据演示没告诉你的那部分未来比四种程序更狠的是 OpenWAM 对训练数据的处理造反事实。一段演示只告诉你演示者做了什么不告诉你别的动作会怎样。换输入救不了这个缺口缺口在训练数据的因果结构里。OpenWAM 的做法是回到模拟器里把轨迹重放尝试替代动作。于是有了 LIBERO-Long-CF10 个任务32000 段反事实轨迹。演示只有 500 段存根反事实有 32000 段。每段反事实含 128 个控制指令总控制数 409.6 万。按 20Hz 折算反事实等价 56.9 小时演示只有 1.92 小时。干预分成 7 个家族停止缩放、反向重定向、轴偏置、偏航扰动。还有随机噪声、夹爪干预、随机时长干预。夹爪干预占了 31.3%是最常见的改动。75% 的反事实从演示中途出发25% 先加一个扰动再出发。扰动后的起点末端执行器平均偏离演示路径 3.34 厘米。61.6% 的起点里物体会跑出演示配置。接触率 90.4%一半起点检测到抓取72.3% 改变了物体配置。数据质量先验成立反事实确实在教别的动作会怎样。同一起始状态的分支会一起留在训练或测试侧避免泄漏。每个转移独立成样本损失不直接对比分支对。冻结逆动力学模型21.5% 到 84% 的迁移实验反事实数据的价值在冻结逆动力学模型的迁移实验里爆发。逆动力学模型负责把未来视频翻译成动作轨迹。OpenWAM 训练了两个接口版本局部上下文与全上下文。局部版本只接收当前观测、本体感知与给定的未来视频。全版本额外接收任务语言与任务前历史。冻结在 LIBERO-Long 上训练好的逆动力学模型去适配 4 个新任务。四个新任务来自 LIBERO-90不在逆动力学模型的训练集里。换任务时只有视频预测器重新适配逆动力学模型一次都不再训练。动作组件任务64任务74任务21任务45平均VTA 参考94869210093.0全上下文·仅演示88900044.5全上下文·混合549243847.0局部上下文·仅演示36500021.5局部上下文·仅反事实8092907684.5局部上下文·混合7486888884.0原始 VTA 未适配4200010.5局部上下文逆动力学模型只吃演示平均 21.5%几乎不可用。加入反事实数据后直接跳到 84.0%。只吃反事实更高84.5%。全上下文逆动力学模型加上混合数据也只有 47.0%。反事实是局部接口能用的前提没有它局部信息根本不够。保留演示还能保住源任务技能混合训练 94.4%反事实单独是 90.6%。逆动力学模型的复用把换任务重训变成了换视频预测器。正向动力学未来真的会跟着动作走吗正向动力学模型回答另一个问题未来真的会跟着动作走吗。OpenWAM 准备了 2560 个反事实未来10 个任务各 160 个起点、16 条动作分支。每个模型拿到相同观测与候选动作预测对应未来。指标是 RGB 均方误差与结果准确率。结果准确率问预测里最接近真实结果的那个是不是所给动作的后果。只吃演示时16 选 1 的准确率只有 21.1%。加入反事实后飙到 71.3%翻了三倍还多。反事实还把 RGB 均方误差砍掉 34.5%。模型只有见过替代动作的后果才分得清动作与未来的因果。这是 OpenWAM 全篇最硬的一个实验证据。统一模型与特化模型单模型部署 vs 单项精度最后一道题能不能把策略、逆动力学、正向动力学塞进同一个模型。OpenWAM 真训练了一个统一 checkpoint60% 联合生成、20% 逆动力学、20% 正向动力学。统一模型在 LIBERO-Long 上拿到 92.8%对比 UVA 的 88.0%。动态指标上统一模型也全面领先 UVA。但特化仍然更值专用策略模型成功率更高。单独训练的逆动力学与正向动力学反事实预测更准。统一模型的意义是证明可行特化模型的意义是证明更好。工程上怎么选取决于你要的是单模型部署还是单项精度。真实双机械臂三个任务各 30 秒演示模拟器之外OpenWAM 还上了真实双机械臂。两台 Franka Research 3加上双腕相机与第三视角相机。任务是烤面包、拼 2×2 魔方最后一层、按颜色分杯。VTA 平均 92.1%Joint 平均 91.9%。每个任务只用 200 段左右的演示各跑 30 秒。真实硬件上的差距比模拟器上的差距更小。说明四种程序的差异主要影响数据效率不影响部署性能。对真实机器人来说能稳定跑起来比榜上高零点几分重要。上手路径一个 pip 安装就能跑冒烟OpenWAM 从第一天就开源仓库在 GitHub 的 OpenWAM/OpenWAM。预训练视频权重挂在 Hugging Face 的 OpenWAM-Stanford 名下。Python 包叫 openwam导入名是 open_wam。最省事的路径是装完包直接跑一个 sanity 检查。python -m venv .venv source .venv/bin/activate python -m pip install openwam[train,eval] openwam-sanity \ --cfg configs/examples/public_tiny_synthetic_contract.yaml \ --device cpu --max-batches 1 --rollout-steps 1安装可选 extras能解锁训练与评估命令。全部命令在 CPU 上也能跑通冒烟流程。数据、权重、模拟器源码各自单独准备。公开配置不含本地路径路径通过 local_paths.yaml 注入。局限与下一步OpenWAM 的复用实验目前全在仿真里真机迁移是下一步。冻结逆动力学模型的局部接口很强但长时程规划还没验证。反事实数据依赖模拟器重放真实世界造不出这么干净的反事实。生成顺序的选择最后还是要跟着任务与数据走。论文把代码、权重、配置、评测全公开复现门槛很低。这或许是世界-动作模型第一次有了公共基准的味道。对机器人社区来说共同地基比单点 SOTA 更值钱。下一次发布如果再补上真机迁移OpenWAM 就是世界-动作模型赛道的标准起点。