ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

V-JEPA 2 与 World Model:AI 如何从视频中学习物理规律与动作结果

V-JEPA 2 与 World Model:AI 如何从视频中学习物理规律与动作结果 把一段“杯子从桌边滑落”的视频交给普通图像分类器它可能识别出杯子、桌子和手交给视频问答模型它可能复述“有人碰到了杯子”。世界模型追求的目标更进一步根据已经看到的状态估计接下来可能发生什么如果机器人向左推、向右抓或者保持不动分别会把环境带到什么状态再从这些候选结果里选择更接近目标、同时满足约束的动作。Meta 在 2025 年发布的 V-JEPA 2 把这条路线拆成两个阶段。第一阶段从大规模互联网视频和图像中学习不带动作条件的视觉表征重点是理解运动、对象交互和未来变化第二阶段得到 V-JEPA 2-AC用少量带机器人控制信号的视频训练动作条件预测器再把预测器放进模型预测控制循环。论文展示了视频理解、动作预判以及机械臂到达、抓取和放置实验但这些结果不等于一个下载后即可安全接管任意机器人的通用控制器。1. World Model 不是一段会描述世界的文字世界模型可以理解为对环境状态转移的可学习近似。观测记为o_t编码器把它压缩为状态表征z_t动作记为a_t预测器估计执行动作后的表征z_(t1)。规划时并不要求模型把未来完整画成视频只要它能区分“哪个候选动作更可能接近目标”就能提供决策价值。这个定义包含理解、预测和规划三个层次。理解回答当前画面中有什么、对象正在怎样运动预测回答在没有额外干预或给定某个动作后状态将怎样变化规划反过来搜索动作让预测状态逐步靠近目标。只做视频分类的编码器可以具备很强的理解能力却未必知道机器人某个控制量的因果后果只会生成逼真视频的模型也未必适合控制因为画面看起来合理不代表动作对应关系、碰撞约束和距离关系足够准确。“学到物理规律”也要谨慎理解。模型从数据中捕获的是对任务有用的统计规律和状态转移结构并没有自动获得一套可解释、守恒且普遍成立的物理方程。它可能在训练分布内预测物体通常向下落、遮挡后仍然存在却仍会在镜面、透明物、软体物、罕见碰撞或者摄像机变化下失败。研究展示应该称为物理理解和规划能力的证据而不是“模型已经理解真实世界”的终局证明。2. 为什么视频比静态图片更接近世界模型的数据单张图片包含对象、材质、空间布局却缺少“变化”。视频天然给出时间上的相邻状态手伸向杯子夹爪闭合杯子被抬起球撞到挡板方向发生改变抽屉被拉开后内部空间出现。即使没有人工标签前后帧之间也构成监督信号模型可以通过预测被遮住的时空区域学习哪些视觉因素具有稳定性哪些变化与上下文相关。不过普通互联网视频通常只有观察没有执行者的控制记录。看到人把杯子拿走并不知道机械臂关节发送了什么指令也无法严格区分主动动作、外部扰动和摄像机运动。因此V-JEPA 2 先做 actionless pre-training利用规模巨大的无动作视频学习视觉状态和运动规律随后再用包含控制动作与本体状态的机器人轨迹做 action-conditioned post-training。前者解决“丰富经验从哪里来”后者补上“我的动作会造成什么变化”。这种两阶段设计比从零开始只用机器人数据训练更实际。高质量机器人轨迹需要硬件、场地、遥操作人员和故障处理采集成本远高于公开视频但互联网视频的视角、剪辑、帧率和动作主体又与机器人控制不同。V-JEPA 2 的路线并没有消除领域差异而是先利用视频形成较好的视觉表征再让动作条件预测器适配控制数据。3. JEPA 的关键选择预测表征而不是重建像素像素重建要求模型回答每个位置的颜色。未来画面中背景纹理、光照噪声、树叶抖动和摄像头压缩都可能有很多合理答案把容量消耗在这些细节上不一定有助于判断杯子是否被抓住。JEPA 的做法是先用目标编码器把目标区域转换成潜在表征再让预测器根据可见上下文去逼近这个表征。模型学习的是“什么信息值得在表征里保留”而不是逐像素复制。可以把一段视频切成时空 token然后遮住其中一部分。上下文编码器只读取可见 token预测器接收上下文表示以及目标位置的信息输出被遮区域的预测表示目标编码器读取完整视频产生训练目标。损失比较预测表示与目标表示之间的距离。目标编码器不通过普通反向传播直接更新而是跟随上下文编码器参数的指数移动平均从而提供相对平稳的目标并降低表征坍塌风险。这里常见的误解是“V-JEPA 会生成未来视频”。预训练主目标发生在潜在空间官方模型并不以像素生成器为主要输出。研究人员可以额外训练解码器把潜在状态可视化但那是解释探针不应倒过来把模糊重建图当成模型真正的训练目标。潜在预测的优势是忽略难预测但与任务无关的细节代价是编码器也可能丢掉规划真正需要的信息所以表征质量必须通过下游任务和控制实验检查。4. V-JEPA 2 的编码器与预测器如何配合V-JEPA 2 使用视频 Vision Transformer 家族作为编码器。输入视频按空间 patch 和时间 tubelet 切分经过位置编码和多层注意力后得到一组时空表征。论文研究了从 ViT-L 到 ViT-g 的不同规模并使用更长视频、更高分辨率和分阶段训练提升能力。编码器是下载后最容易直接复用的部分可用于视频分类、检索、动作识别也可以作为视频语言模型的视觉前端。预测器比大编码器更轻量。预训练时它根据上下文 token 和目标位置预测目标编码器在被遮区域产生的表示。编码器负责把原始高维视频压缩成任务相关状态预测器负责学习表示之间的条件关系。两者分工很重要冻结编码器后训练一个轻量读出头可以测量表征中是否已经包含动作类别或未来动作线索这类 probe 成绩说明“信息可被读出”不等于整个端到端业务已经解决。进入 V-JEPA 2-AC 阶段后动作条件预测器接收视觉表征、机器人动作以及本体观测按因果顺序预测未来表征。这里的 AC 是 action-conditioned。相同起始画面配上不同动作应当得到不同未来状态如果预测器忽略动作只学习场景平均变化就无法用于规划。论文冻结预训练视频编码器重点训练与机器人轨迹对应的预测模块使大规模视觉经验与少量交互数据连接起来。互联网视频与图像时空遮罩上下文编码器EMA 目标编码器潜在表征预测器表征预测损失预训练 V-JEPA 2 编码器动作条件预测器后训练机器人视频 动作 本体状态V-JEPA 2-AC 世界模型候选动作滚动预测目标图像执行第一步并重新规划5. Actionless 预训练到底学到了什么第一阶段不要求人工写下“这是抓取”“下一秒将放下杯子”。模型从视频本身构造训练目标隐藏一部分时空区域再根据其余区域预测目标表征。论文使用的视频与图像集合覆盖超过一百万小时视频和约一百万张图像并组合 Curated-YT-1B、Something-Something v2、Kinetics、HowTo100M、ImageNet 等来源形成训练集合。数据量很大但规模不等于没有偏差公开视频中的地域、活动、拍摄方式和版权条件都会影响表征。遮罩迫使模型利用时间和空间上下文。如果杯子短暂被手遮挡预测目标表示不能只抄当前像素如果动作方向决定“把东西放进”还是“从里面拿出”只识别对象类别不够。随着数据和模型规模增加冻结编码器上的动作识别与预判任务得到提升说明潜在表征包含了更多运动结构。然而这仍是统计学习模型没有显式接收质量、摩擦系数和重力公式也不能保证在训练分布外遵守这些约束。论文还报告了训练计算上的现实约束。更长的帧序列与更高分辨率会显著增加计算量因此采用由较短、较低分辨率逐步提升到 64 帧和更高分辨率的训练方案。技术报告估算如果从头直接以高分辨率长片段训练大型编码器成本会非常高。工程团队要复用公开权重而不是把“自监督无标签”误解成“低成本”不需要人工标签只是把成本转移到了视频清洗、存储、解码和分布式计算。6. 从表征到理解、预判与视频问答V-JEPA 2 的能力需要通过不同接口读取。动作分类通常冻结编码器再训练较小的 attentive probe动作预判会同时利用编码器和预测相关特征判断一秒后最可能发生的动词与名词视频问答则把视觉编码器与语言模型对齐。三类实验依赖的头部、训练数据和指标不同不能把某个问答分数说成“裸编码器无需训练即可回答问题”。论文报告大型配置在 Something-Something v2 上取得 77.3 的 top-1在 EPIC-KITCHENS-100 动作预判上取得 39.7 的 Recall5与语言模型对齐后的 8B 规模系统在 PerceptionTest 和 TempCompass 等视频问答评测中也给出较强结果。这些数字应连同设置一起引用前两项使用探针或预判头问答还包含语言对齐数据和语言模型指标之间不能横向互换。更重要的是论文主动列出限制。EPIC-KITCHENS-100 关注厨房环境和闭集动作词表预判时间主要为一秒时间跨度拉长后性能会下降。一个模型能在基准中识别“放下杯子”并不意味着它能判断工厂机械故障、自动驾驶危险或医疗操作结果。业务验证必须重建与真实摄像机、对象、动作和时间尺度一致的评测集。7. Action-conditioned 后训练补上的因果接口只看视频时预测器学习z_t - z_(t1)用于控制时需要的是(z_t, a_t, p_t) - z_(t1)其中p_t表示机械臂关节、末端执行器或夹爪等本体状态。动作条件让模型能够比较反事实候选“当前画面相同如果夹爪向左移动五厘米会怎样如果闭合夹爪又会怎样。”这不等于严格识别了所有因果关系但至少给规划器提供了可操作的条件变量。V-JEPA 2-AC 使用 DROID 原始数据中的约 62 小时无任务标签机器人视频进行后训练。DROID 完整数据集更大包含多场景、多任务遥操作轨迹论文使用的是其中与其训练方案匹配的子集。所谓 unlabeled 指不需要成功奖励或人工任务类别并不代表数据什么都没有轨迹仍需同步视频、控制动作和本体观测这些结构化信号正是动作条件预测所必需的。后训练后的模型针对固定外部相机下的 Franka Panda 桌面机械臂实例化动作对应末端执行器控制。这个限定很关键。不同机械臂自由度、控制频率、相机位置、夹爪形式与动作单位都会改变条件分布。公开权重可以作为研究起点却不能省去硬件适配、坐标校准、延迟测量和安全验收。8. 规划不是一次生成动作而是不断试算和纠偏论文采用模型预测控制。给定当前观测与目标图像规划器采样一批候选动作序列让 V-JEPA 2-AC 在潜在空间滚动预测每条序列的结果再计算预测状态与目标表征之间的能量或距离。Cross-Entropy Method 根据低成本候选更新采样分布多轮收敛后只执行第一步动作。机器人得到新画面后重新编码、重新规划因此早期误差不会无限开环累积。短时任务可以只给最终目标图像例如夹爪到达某位置抓取再放置这样的长任务则提供一系列视觉子目标。Meta 公开文章报告在其两处实验室、指定机械臂与任务设置下对新物体和新环境的 pick-and-place 成功率为 65% 到 80%。这个范围是研究实验结果不应改写成“任何场景成功率 80%”。试验次数、物体组合、相机与任务定义都必须回到论文表格理解。模型预测控制还揭示了潜在世界模型的价值不必为每个候选动作生成一段高清未来视频只需得到足够区分结果的表示并计算目标距离。但潜在距离也可能出现捷径。例如背景相似度压过了夹爪与物体关系规划器会选择画面看起来接近目标却没有真正抓住物体的动作。因此成本函数通常还需加入动作平滑、工作空间、碰撞、夹爪状态和任务阶段等约束。9. 最小视频表征先验证编码器再谈世界模型下面示例展示如何从官方 Hugging Face 模型卡提供的接口加载编码器将均匀采样的视频帧转换为一个归一化向量。它适合验证环境、比较两段视频相似度或构建检索基线不包含动作条件预测器也不会输出未来画面。生产代码应固定经过审核的模型 revision并在离线环境缓存权重不要对不可信仓库开启远程自定义代码执行。# encode_video.pyfrom__future__importannotationsfrompathlibimportPathimportnumpyasnpimporttorchfromPILimportImagefromtransformersimportAutoModel,AutoVideoProcessor MODEL_IDfacebook/vjepa2-vith-fpc64-256defload_frames(frame_dir:str,count:int64)-np.ndarray:pathssorted(Path(frame_dir).glob(*.jpg))ifnotpaths:raiseValueError(frame directory contains no jpg files)indicesnp.linspace(0,len(paths)-1,count).round().astype(int)frames[]forindexinindices:withImage.open(paths[index])asimage:frames.append(np.asarray(image.convert(RGB)))returnnp.stack(frames)# T x H x W x Ctorch.inference_mode()defencode_video(frame_dir:str,device:strcpu)-torch.Tensor:processorAutoVideoProcessor.from_pretrained(MODEL_ID)modelAutoModel.from_pretrained(MODEL_ID,trust_remote_codeFalse,).eval().to(device)videoload_frames(frame_dir)inputsprocessor(video,return_tensorspt)inputs{name:value.to(device)forname,valueininputs.items()}tokensmodel(**inputs,skip_predictorTrue).last_hidden_state vectortokens.mean(dim1)returntorch.nn.functional.normalize(vector,dim-1).cpu()if__name____main__:embeddingencode_video(frames/demo)assertembedding.ndim2andembedding.shape[0]1print(embedding.shape)这段代码假定视频已经按顺序抽成 JPEG 帧。真实系统不能把“取 64 张图”当成统一正确答案要记录原视频帧率、采样时间戳、裁剪方式和处理器版本。快动作需要更密采样长流程需要滑动窗口直接把十分钟压成 64 帧很可能错过接触瞬间。官方仓库还依赖视频解码组件并提示部分平台的decord兼容性问题因此环境验收应包含真实视频而不是只看模型能否 import。用于检索时池化策略也要评测。简单平均会把短暂但关键的动作稀释动作分类探针通常读取多层或使用注意力汇聚。最小示例的价值是建立可重复输入和输出形状不是复刻论文全部评测。若相似度结果不理想应先检查采样与预处理是否与权重匹配再考虑微调避免用更多训练掩盖数据管道错误。10. 用潜在状态给候选动作打分下面代码实现一个与具体模型解耦的最小规划核心动作条件预测器接收当前潜在状态和候选动作返回下一状态评分器计算与目标表征的余弦距离并叠加动作幅度和越界惩罚。示例中的toy_predictor只是可运行自检不是 V-JEPA 2-AC 权重。接入官方模型时应保留相同的批量输入、约束和审计接口把 predictor 替换为经过校准的推理函数。# score_actions.pyfrom__future__importannotationsfromcollections.abcimportCallableimportnumpyasnp PredictorCallable[[np.ndarray,np.ndarray],np.ndarray]defcosine_distance(left:np.ndarray,right:np.ndarray)-np.ndarray:left_normleft/np.maximum(np.linalg.norm(left,axis1,keepdimsTrue),1e-8)right_normright/np.maximum(np.linalg.norm(right,axis1,keepdimsTrue),1e-8)return1.0-np.sum(left_norm*right_norm,axis1)defrank_actions(current:np.ndarray,goal:np.ndarray,candidates:np.ndarray,predictor:Predictor,action_limit:float0.12,)-list[tuple[int,float]]:ifcurrent.ndim!1orgoal.shape!current.shape:raiseValueError(current and goal must be equal-length vectors)ifcandidates.ndim!2:raiseValueError(candidates must be a two-dimensional array)repeated_statenp.repeat(current[None,:],len(candidates),axis0)predictedpredictor(repeated_state,candidates)ifpredicted.shape!repeated_state.shape:raiseValueError(predictor returned an unexpected shape)targetnp.repeat(goal[None,:],len(candidates),axis0)goal_costcosine_distance(predicted,target)motion_cost0.05*np.sum(candidates**2,axis1)unsafenp.any(np.abs(candidates)action_limit,axis1)totalgoal_costmotion_costunsafe.astype(float)*1_000.0returnsorted(enumerate(total.tolist()),keylambdaitem:item[1])deftoy_predictor(states:np.ndarray,actions:np.ndarray)-np.ndarray:predictedstates.copy()predicted[:,:actions.shape[1]]actionsreturnpredictedif__name____main__:statenp.array([1.0,0.0,0.0])targetnp.array([0.9,0.1,0.0])actionsnp.array([[0.0,0.1],[-0.1,0.1],[0.5,0.0]])rankingrank_actions(state,target,actions,toy_predictor)assertranking[0][0]1assertranking[-1][0]2print(ranking)真正的模型预测控制会给每个候选动作序列做多步 rollout并使用 Cross-Entropy Method 反复更新采样分布。最小代码故意只展示一步因为多步并不是简单循环越多越好预测误差会随步数累计控制延迟也会增长。实际系统应固定规划周期在截止时间前返回可行动作超时、没有安全候选或模型不确定时执行停止或受验证的保守策略而不是挑一个“分数最低但仍不安全”的动作。11. 数据管道比模型名字更决定结果动作条件数据必须在同一时间线上对齐图像、控制指令和本体状态。相机时间戳晚一百毫秒可能把“夹爪闭合”错误对应到物体已经移动后的画面控制频率与视频帧率不同需要明确重采样、保持或插值规则。每条轨迹应保存机器人型号、控制坐标系、动作单位、相机内外参、帧时间戳、急停事件和采集软件版本不能只留下 MP4 与一个动作数组。数据拆分也不能随机把相邻轨迹分到训练集和测试集。相同桌面、相同物体和相同操作者会造成泄漏让“新环境”看起来比实际容易。更可信的拆分按场景、对象集合、相机位置或实验室留出并单独报告分布内与分布外结果。失败轨迹不应全部删除因为只保留成功演示会让模型看不到碰撞、滑落和误抓状态但失败标签和安全事件要经过审查防止危险行为被无差别模仿。互联网预训练数据同样需要治理。视频许可决定能否用于训练与再分发人物、家庭和工作场景可能包含隐私数据去重不充分会污染下游测试集。V-JEPA 2 论文描述了对目标验证集的去重与数据策展业务团队仍需对自己的数据来源、保留周期、访问权限和删除链路负责。公开权重允许某种许可证用途不等于输入数据自动合规。12. 如何读懂基准而不是只摘最高分动作识别基准测试“表征能否区分已定义类别”动作预判测试“上下文能否提示近期动作”视频问答测试还混合了语言理解与对齐能力机器人实验测试指定硬件、相机和目标形式下的闭环规划。它们共同提供证据但没有任何单一分数能证明模型具备通用世界模型能力。部署决策应把指标映射到自己的失败成本。Meta 同期发布 IntPhys 2、MVPBench 和 CausalVQA用不同方式暴露捷径。IntPhys 2 让模型在成对视频中判断违反物体恒存、不可变、时空连续或实体性的场景MVPBench 使用最小变化的视频对和相反答案只有一对都答对才计分降低语言与画面偏置带来的侥幸CausalVQA 覆盖反事实、假设、预判、规划和描述问题。官方报告中人类在这些评测上明显领先而多种强模型仍存在较大差距。这组基准提醒我们模型能说出“视频里发生了什么”不等于能稳定回答“如果没有这次碰撞会怎样”或“下一步怎样完成目标”。评测集应包含反例对和干预变量。例如只改变夹爪开闭状态、只移动目标物、只替换背景或改变相机角度观察模型评分是否跟随真正因果因素。如果背景一换就翻转决策说明系统学到的可能是视觉相关性而不是可用于控制的状态结构。13. 失败模式一表征忽略了业务真正需要的细节潜在空间会主动舍弃难预测或被认为不重要的信息这既是优势也是风险。对于动作识别杯子花纹可能不重要对于质量检测裂纹、刻度和液面高度却可能决定动作。若预训练目标没有保留这些细节后面的规划器再复杂也无法恢复。可以训练轻量探针检查关键属性是否可读并通过遮挡、颜色、纹理和位置干预测试模型是否依赖正确特征。透明物体、反光金属、柔性材料、绳索、液体和高速接触都是典型难例。二维单目视频还存在深度歧义同一投影可能对应多个三维状态。V-JEPA 2 的研究实例以固定外部相机和桌面机械臂为主不能据此假设移动相机、多摄像头、触觉或力控问题已经解决。必要时加入深度、力矩和触觉传感器并把缺失或不同步视为安全故障。14. 失败模式二短期预测好不代表长期规划可靠单步潜在预测误差很小多步滚动仍可能逐渐偏离真实状态。模型训练常见的是短片段和有限时间尺度长期任务却包含阶段切换、遮挡恢复和不可逆动作。Meta 的公开说明也把多时间尺度、层级规划列为后续方向。把“能预测下一秒动作”直接外推到“能规划十分钟流程”属于超过证据范围的宣传。工程上应同时报告一步误差、不同 horizon 的误差曲线和闭环任务成功率。闭环重规划能纠偏却不能修复所有问题一次错误抓取可能已经损坏物体一次碰撞也无法靠下一帧重新规划撤销。对不可逆动作设置独立审批或验证器把长任务分成可检查的技能并在阶段边界重新确认目标和环境状态。15. 失败模式三目标距离被视觉捷径欺骗当目标是一张图片时潜在距离可能把相机视角、背景和光照当作重要差异。机器人也可能通过遮住物体、移动镜头或停在相似构图位置降低距离却没有完成业务目标。应设计针对任务的成功检测器例如夹爪是否真正承重、物体是否进入指定区域、接触力是否超限并将其与世界模型距离分开记录。候选动作搜索也有覆盖问题。模型可能知道正确动作的后果但采样器从未提出该动作或者 CEM 太早收缩到局部最优。诊断时要区分感知失败、动力学预测失败、成本函数失败和搜索失败。记录每轮候选分布、预测成本、安全过滤原因与最终执行动作才能在事故后还原“模型没看到”还是“规划器没选到”。16. 机器人安全不能交给相似度分数世界模型属于决策建议层不是唯一安全层。控制命令下发前至少经过关节限位、速度与加速度限制、工作空间、碰撞检测、力矩阈值和急停检查这些约束应由确定性控制器或通过认证的安全组件执行。模型即使高置信也不能绕过硬限制模型超时、输入缺帧、相机遮挡、时钟漂移和显存异常都应触发保守降级。上线前从数字孪生或隔离测试台开始随后以低速、软物体和受限空间逐步扩大范围。每个阶段定义允许任务、禁止对象、最大动作幅度、人工接管条件和回滚方式。对人机共处、医疗、车辆和重型设备研究代码与一般机器学习评测远远不够还需要行业法规、功能安全分析和独立验证。安全还包括模型与数据供应链。权重从官方渠道获取并校验摘要依赖固定版本视频解码在受限环境运行不可信视频可能利用解码器漏洞或制造资源耗尽。训练轨迹和实验视频可能包含人员与实验室信息权限、脱敏、删除和审计必须覆盖原视频、抽帧、特征、日志与缓存。17. 哪些能力现在可以用哪些仍是研究问题可直接尝试的是公开 V-JEPA 2 编码器做视频特征提取、相似检索、少样本动作分类或作为视频语言系统的视觉骨干。即便如此也应在自有视频上验证采样策略、延迟、显存和表征是否覆盖业务属性。Hugging Face 模型卡明确列出分类、检索和 VLM 编码器等用途官方仓库提供检查点和演示代码这些属于可复现实验入口。需要较大工程投入的是 V-JEPA 2-AC 控制它依赖匹配的机械臂动作空间、同步轨迹、规划循环、目标表示和安全控制器。论文的 zero-shot 指部署实验室环境和物体相对训练数据未做环境特定采集或任务特定训练不是“对任意机器人零配置”。把权重接到不同硬件上之前必须处理控制频率、坐标系和观测差异。仍属开放研究的问题包括长时间层级规划、语言目标直接落到动作、跨机器人形态迁移、多传感器预测以及可靠不确定性估计。Meta 公开材料也明确指出当前模型主要在单一时间尺度上预测并把音频、触觉等多模态 JEPA 列为未来方向。产品路线应围绕已有证据安排而不是把研究愿景写成当前 SLA。18. 一条可落地的验证路线第一阶段只验证编码器。选取几百段真实视频建立动作、对象状态和困难条件标签比较冻结表征上的线性或注意力探针与现有视觉基线。保留逐场景结果不只看平均准确率检查相机变化、遮挡、光照和新对象下的退化。这个阶段不连接机器人执行端。第二阶段构造最小动作条件任务。选择低自由度、可恢复的到达任务采集严格同步的画面、动作和本体状态训练一步预测器评估不同动作下的潜在预测与真实后继状态排序是否一致。先验证候选动作排名再进入仿真闭环如果排序在反事实动作上不稳定继续堆叠规划器没有意义。第三阶段在受限实体环境进行闭环测试。动作先过硬约束速度降低人工随时急停按物体、初始位姿、相机扰动和未见背景分桶统计成功、碰撞、超时、人工接管与近失事件。只有安全指标和任务指标同时达标才能扩大对象和工作空间。每次模型、权重、预处理或控制参数变化都回放固定轨迹集。小结V-JEPA 2 的核心不是“让 AI 生成更逼真的视频”而是用遮罩式自监督在潜在空间学习可预测的视觉状态。编码器把视频变成表征预测器根据上下文逼近缺失区域的目标表征大规模无动作视频提供运动与对象交互经验带控制信号的机器人轨迹再把动作接入预测器。V-JEPA 2-AC 由此可以在潜在空间试算候选动作并通过模型预测控制反复执行一步、观察一步、重新规划。它提供了理解、预测和规划之间的一条有说服力的研究路径也公开了模型、代码与多类基准。但基准领先、实验室 zero-shot 和生产可用是三个不同结论。真正落地必须验证表征是否保留关键细节动作与画面是否同步长期误差是否可控搜索与成本函数是否存在捷径以及硬件安全层能否在模型失效时兜底。把这些边界说清楚比把“世界模型”包装成万能大脑更接近技术本身的价值。参考资料Meta AIIntroducing the V-JEPA 2 world model and new benchmarks for physical reasoningV-JEPA 2 论文Self-Supervised Video Models Enable Understanding, Prediction and PlanningMeta 官方 V-JEPA 2 PyTorch 代码库Meta 官方 V-JEPA 2 Hugging Face 模型集合Hugging Face TransformersV-JEPA 2 模型与预处理接口V-JEPA 论文Revisiting Feature Prediction for Learning Visual Representations from VideoDROID 论文A Large-Scale In-The-Wild Robot Manipulation DatasetDROID 数据集官方网站IntPhys 2 官方代码与评测说明MVP 论文A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video PairsCausalVQA 官方代码与数据说明
返回列表