ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

JEPA 世界模型如何做好长程任务?Dual-WM 的双潜空间、LoRe 与规划实现

JEPA 世界模型如何做好长程任务?Dual-WM 的双潜空间、LoRe 与规划实现 短程任务成功率还不错目标一旦变远规划却明显变难。这是世界模型与视觉规划中一个值得追问的现象单步预测准长程规划就一定稳吗对于依靠潜空间预测和目标距离进行规划的这类 JEPA 世界模型状态表征既要预测动作后果也要比较候选未来的任务进展。局部预测准确并不自动保证递归预测一致或远处的目标距离仍然有区分度。Dual-WM 为局部执行和长程规划学习不同的 latent space 和各自的动力学再通过低层状态窗口连接两层。本文按照问题、设计、训练、规划的顺序展开最后给出公开实现的阅读与评价入口。论文Beyond a single latent space: a dual-latent world model for long-horizon planning训练与规划核心实现1. 长程规划的两个卡点想偏了或者分不清想偏了递归预测漂移。规划中上一步预测成为下一步的输入。局部训练时不大的误差经过多次递归可能累积和放大使想象轨迹偏离真实未来。分不清高维距离集中。即使候选未来预测准确规划器仍需要区分哪些候选更有任务进展。当目标代价过于接近时搜索缺少清晰的排序信号。在基于潜空间距离的目标规划中候选动作先通过动力学得到预测状态再由预测状态到目标的距离评价。这个距离承担了比较任务进展的作用。在高维、各向同性正则化的状态表征中时间相关性减弱后距离可能趋近维度相关的基准。不同候选未来的目标代价变得相近就会削弱动作搜索所依赖的排序信号。论文以零均值、单位协方差状态给出参考关系ρ h 1 d E [ z t ⊤ z t h ] , E ∥ z t − z t h ∥ 2 2 2 d ( 1 − ρ h ) . \rho_h\frac{1}{d}\mathbb E[z_t^\top z_{th}],\qquad \mathbb E\|z_t-z_{th}\|_2^22d(1-\rho_h).ρh​d1​E[zt⊤​zth​],E∥zt​−zth​∥22​2d(1−ρh​).当 ρ_h 接近零平均平方距离接近 2d独立标准高斯参考下的距离还具有随维度增加而减小的相对波动。这个分析促使我们单独检验潜空间的目标距离是否仍能反映长程任务进展。长程规划需要预测一致性也需要有区分度的目标距离。2. 缩短预测链之后为什么还需要两个潜空间平坦世界模型可以改进预测与搜索层次世界模型可以通过时间抽象缩短长程路线搜索的递归深度。但在仍然共享 latent space 的方案中局部执行和远期目标评价继续依赖同一套状态几何。缩短预测链本身不会改变这套几何距离已经趋于饱和时远处的候选仍可能难以比较。局部执行与长程规划对表征提出不同要求。低层要区分影响即时动作效果的状态变化高层要在较大时间跨度上比较任务进展。Dual-WM 分开学习两套状态表征与动力学时间角色状态构造动力学输入规划作用低层局部执行z_L E_L(o)原始动作输入精细动作转移、最终目标匹配高层长程规划z_H E_H(W_L)学习得到的宏动作较长跨度预测、隐空间子目标评价两层共享视觉骨干。高层通过 E_H 将低层状态窗口映射到另一个状态空间并在宏步动力学目标下训练分工发生在状态表征和动力学层面。因此时间抽象、状态几何和动作接口一起设计高层步覆盖多个低层步同时使用适合该时间角色的状态表征来评价目标。3. 窗口接口高层状态具体从哪里来W_L 是长度 k 的低层 latent window高层编码为z t H E H ( W t L ) . z_t^HE_H(W_t^L).ztH​EH​(WtL​).单帧初始化时重复当前低层 latent 填满窗口。训练中高层分支接收停止梯度的低层窗口高层损失更新高层模块低层保留自己的预测目标。一个高层转移覆盖 k 个低层模型步即 kf 个环境步。训练 rollout 长度 N/M 与规划 horizon H_L/H_H 分别设置goal offset 则表示数据轨迹中起点与目标的环境步间隔。4. LoRe在两种时间尺度上训练自生成预测LoRe 在编码起点之后持续递归下一步预测成为后续输入真实未来观测提供监督目标。低层和高层分别设置预测长度与指数衰减权重。L L o R e s ∑ h 1 n s w h s ∥ z ^ h s − z h s ∥ 2 2 , w h s exp ⁡ ( − α s h ) ∑ j 1 n s exp ⁡ ( − α s j ) . \mathcal L_{\mathrm{LoRe}}^s\sum_{h1}^{n_s}w_h^s\|\hat z_h^s-z_h^s\|_2^2, \qquad w_h^s\frac{\exp(-\alpha_s h)}{\sum_{j1}^{n_s}\exp(-\alpha_s j)}.LLoRes​h1∑ns​​whs​∥z^hs​−zhs​∥22​,whs​∑j1ns​​exp(−αs​j)exp(−αs​h)​.分别设置 α_L、α_H是因为两层的一个预测步代表不同的实际时间跨度误差传播也可以不同。有限衰减保留每个已纳入 horizon 的监督同时调节远期误差的训练权重。指数权重的动机来自递归误差传播分析。在固定动作序列、共享编码起点、预测器具有 Lipschitz 常数L s L_sLs​且单步残差有界的条件下误差满足e h s ≤ ϵ s ∑ j 0 h − 1 L s j e_h^s\leq\epsilon_s\sum_{j0}^{h-1}L_s^jehs​≤ϵs​∑j0h−1​Lsj​。用于平衡加权平方误差上界的参考权重在L s 1 L_s1Ls​1的长跨度情形下趋于几何衰减这启发了 LoRe 的指数权重。训练保留所有纳入跨度的监督同时调节被放大的远期误差的影响。α s 0 \alpha_s0αs​0时恢复均匀权重低层与高层的衰减率分别设置。下面是损失汇总的简化示意predictions应由自生成的递归链产生importtorchdeflore_loss(predictions,targets,alpha):errorstorch.stack([(pred-target).square().mean()forpred,targetinzip(predictions,targets)])htorch.arange(1,len(errors)1,deviceerrors.device,dtypeerrors.dtype,)weightstorch.softmax(-alpha*h,dim0)return(weights*errors).sum()公开代码的scripts/train/dual_wm.py中weighted_mean汇总逐步误差dual_wm_dynamics_forward连接两层 rollout 与训练损失。论文从 1 编号、代码从 0 编号在归一化指数权重下等价。5. MAPS把宏动作表征接到采样搜索MAPS 对记录动作窗口的宏动作后验施加朝向标准高斯的 KL 正则L M A P S E A ∼ D D K L ( q ϕ ( u ∣ A ) ∥ N ( 0 , I ) ) . \mathcal L_{\mathrm{MAPS}} \mathbb E_{A\sim\mathcal D}D_{\mathrm{KL}}\big(q_\phi(u\mid A)\|\mathcal N(0,I)\big).LMAPS​EA∼D​DKL​(qϕ​(u∣A)∥N(0,I)).宏动作预测目标保留动作片段效果的信息先验约束为规划候选生成提供共同的采样基础。规划时未来宏动作是优化变量。随机编码的 β0 配置保留随机后验确定性编码是另一项条件。6. 三阶段规划动力学在低层子目标比较在高层高层路线搜索CEM 优化宏动作序列高层动力学生成隐空间子目标。低层动作细化P_L 预测候选动作的状态窗口再用 E_H 映射与高层子目标比较。低层直接收敛完成设定的高层引导细化轮数后切换到直接低层目标代价。阶段二的核心接口是cost ⁡ ( A ) ∥ E H ( W ^ t L ( A ) ) − z ~ j H ∥ 2 2 . \operatorname{cost}(A)\|E_H(\widehat W_t^L(A))-\tilde z_j^H\|_2^2.cost(A)∥EH​(WtL​(A))−z~jH​∥22​.其中候选 A 在低层动力学中预测评价使用高层几何。这个接口连接了不同 latent space 中的路线指导与动作执行最后又用低层距离保留精细完成目标所需的状态差异。7. 方法证据应该怎样读论文使用真实观测的距离与目标排序诊断、自生成预测的物理状态探针以及窗口接口、LoRe、MAPS 的受控研究分别检验状态几何、预测一致性和规划行为。Window-Concat 接口对照与 Dual-WM 接收同一低层窗口保留同一低层 checkpoint 和粗到细规划器用于检验学习高层表征的作用。目标排序与成功率提供互补证据不能只凭排序指标推断全部因果机制。主结果覆盖 TwoRoom、Reacher、PushT、Cube-Single 与 Sokoban-Long。Sokoban 推箱子任务检验了离散动作空间低层使用类别型 CEM 搜索离散动作高层仍在连续宏动作空间规划较长跨度的效果。目标间隔 100 环境步时Dual-WM 在五个任务上均优于对应的逐任务最强基线从头训练的 Dual-WM 平均成功率为 69.5%逐任务最强非 Dual-WM 对照为 61.4%不使用 actor-guided proposals按任务/offset 选取对照并等权平均。完整数值与实验范围见论文。8. 按方法模块阅读公开代码阅读入口对应的方法问题stable_worldmodel/wm/dual_wm/低层状态、高层窗口编码、宏动作与双层动力学scripts/train/dual_wm.py两阶段训练、递归损失、模块冻结和 MAPSscripts/plan/eval_wm.py目标初始化、模型载入、评价流程scripts/plan/config/高低层搜索参数、窗口子目标代价、数据和权重路径README.md训练、评价和五任务权重下载入口TwoRoom 配置中的subgoal_cost.mode: dynamic_window_aligned对应预测窗口与高层子目标的对齐比较。可以由此继续追踪HierarchicalCEMSolver。仓库要求 Python 3.10 及以上。以下按 Linux/bash 展示代码入口gitclone https://github.com/DeLin1001/Dual-WM-Official.gitcdDual-WM-Official python-mpipinstall-e.[envs]根据 README 准备任务数据、预训练权重和环境后TwoRoom 的评价入口为python-mscripts.plan.eval_wm-cntworoom默认配置读取datasets/tworoom_planning_o100.h5和checkpoints/TwoRoomCPT/TwoRoomCPT.pt其他路径可通过STABLEWM_HOME、DUALWM_CHECKPOINT_DIR指定。数据需另外准备。公开仓库覆盖训练与规划核心流程其他实验脚本的发布范围以 README 为准。运行前需按公开 README 准备相应数据、权重及环境依赖。Dual-WM 想探索的是按时间角色组织状态空间让局部转移和长程目标评价分别学习表征再用窗口接口、LoRe 与宏动作规划完成协作。当前研究基于离线数据和固定时间抽象欢迎围绕自适应时间尺度与任务相关目标几何继续讨论。论文https://arxiv.org/abs/2609.37644代码https://github.com/DeLin1001/Dual-WM-Official
返回列表