ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

VLA、世界模型与端到端:智能驾驶的边界与落地

VLA、世界模型与端到端:智能驾驶的边界与落地 今年稍微留意过智能驾驶发布会的朋友大概率会反复听到三个词VLA、世界模型、端到端。听起来像三件套有人把它们绑在一起念有人以为它们是同一个东西的三种叫法但真正动手做过系统的人应该清楚这三个词指的根本不是同一个层次的东西。我见过不少团队在技术规划会上把“上VLA”等同于“上端到端”又把“世界模型”当作“仿真视频生成器”结果方案刚过评审就在工程链路上卡了壳。这篇文章想做的事很简单把这三个概念放到同一张桌上划清边界和层级再结合我接触过的部署经验聊聊从论文里的模型到车端可落地的系统中间到底横着几道坎。文章不会回避争议也不会把所有方案打包成“未来趋势”只讲那些你画架构图之前就得想明白的事。1. 别把这三个词混在一起念经先厘清基本概念1.1 端到端一种系统组织方式不是某个具体模型端到端这个词字面意思很好理解——从传感器原始输入直接到规划或控制输出中间是一条可微的网络链路。但很多人把它理解成“没有中间结果”“全黑盒”这就有偏差了。端到端的本质是系统边界的选择它把感知、预测、规划甚至控制整合进一个可联合优化的整体梯度可以直接从最终控制量反向传播到输入图像而不是像传统模块化架构那样每个模块训练好后用规则或固定接口拼起来上游误差在下游不断叠加。一个比较直观的类比传统模块化系统像一家大公司市场部收集需求设计部画图生产部制造售后部修问题每个部门有严格的交接文档但需求在传递过程里会失真上游一个含糊的表达下游就得返工。端到端则像一个跨职能小团队从客户需求直接交付产品内部可以随时对齐、一起迭代。当然这种“一体化”也带来了全局训练数据要求高、问题定位难的代价。放到今天的智驾量产环境里真正意义上的“全场景端到端”其实很少大量所谓端到端是指“局部端到端”——比如感知和预测合并成可微的图模型或者规划模块直接吃多模态特征输出轨迹。这类系统保留了清晰的中间表达和安全冗余只是让核心决策链路可学习、可优化。判断一个系统是不是端到端别只看宣传口径要看梯度能不能从最终输出流回最前端的传感器输入。1.2 VLA把语言当作“世界接口”的动作模型VLA全称是Vision-Language-Action Model视觉-语言-动作模型。它的结构通常由三块组成视觉编码器、多模态语言模型、动作解码头。视觉编码器负责把环视图像或前视视频转成特征语言模型负责理解场景和指令动作解码头则输出方向盘转角、油门刹车等控制量或者离散化的动作token。VLA最特别的地方是把语言当作一种“世界接口”。传统端到端模型里场景特征是一堆高维向量模型学会了“看到什么就输出什么”但很难解释自己为什么这么做也很难用规则和指令去约束它的行为。VLA则不同它可以把“前方有行人横穿且行人后方视野被遮挡”这类场景描述成一段语义表达再结合任务指令“保持安全距离并减速通过”来决策。语言在这里不是表面上的语音助手而是一种能承载交通规则、物体属性、因果常识的抽象表达。这也是为什么RT-2、π0这类VLA模型能在机器人领域快速铺开——它们用一套模型同时理解世界、听指令、输出动作不再为每个任务单独训练策略。π0还进一步把VLA扩展到了不同的轮式底盘和机械臂组合上说明了VLA天然带有跨形态泛化的能力。放回智驾语境VLA的价值在于它让“驾驶决策”这个本来看不见摸不着的行为变成了可以被语言解释、被指令约束、被常识支撑的可控过程。1.3 世界模型定义到底该是什么世界模型这个概念被滥用得最严重。很多人看见一个能生成连贯视频的模型就管它叫世界模型这其实是把“视觉上合理”当成了“因果上正确”。世界模型的硬指标是预测环境动态并根据当前状态和候选动作推演出未来状态。它要能回答“如果我下一秒猛打方向盘会发生什么”“如果前车突然急刹我的车能否避开”这类反事实问题而不只是生成一帧看起来像真实道路的图像。世界模型和大语言模型的区别就在这里。大语言模型拥有海量的文本知识知道“雨天路滑”“大货车有盲区”但它没有内建的时间和干预结构你给它一张道路图它无法直接在脑海里推演车辆开过去之后的碰撞风险。世界模型则是面向状态转移的它建模的是“现在是什么状态-你做了什么-下一步会变成什么状态”这一段因果链。当然两者并非对立VLA里用语言模型提供常识外部再挂一个世界模型提供动态推演完全可以互补。落到智驾上世界模型有两个大的应用形态。第一是外部仿真模型在云端生成高真实度驾驶场景用来补充长尾数据、做闭环回归测试第二是内部想象把状态转移模块嵌入到决策模型里让模型在规划前先自己在隐空间“多推演几步”挑选未来回报最高的动作。第一种形态相对成熟第二种更性感但难度也高得多。判断一个世界模型靠不靠谱核心就看它能不能对“不同动作产生不同未来结果”保持敏感而不只是生成一条漂亮视频。2. 三者不是并列关系而是一条系统能力的因果链2.1 用一句话判断框架区分三者的层次先给一个我常用的判断框架端到端是系统组织方式VLA是实现形态世界模型是内在能力。它们描述的是同一个智能驾驶系统的不同维度。端到端回答的是“梯度从哪流向哪”描述系统边界——你是把感知到控制放进一条可微链路还是继续保持模块化解耦VLA回答的是“用什么模态和任务表达来组织这条链路”——你是用语言和视觉联合做决策还是只用视觉特征做纯几何决策世界模型回答的是“这个系统能不能预测环境动态、支持反事实推演”——它决定系统在长尾场景里是靠记忆硬扛还是真的能通过推演避开风险。这三个维度也可以独立存在。你可以做一个完全没有世界模型的端到端模型很多实车采集的数据直接训练感知到控制的映射就是这样。你也可以用世界模型去增强一个非端到端的规则系统比如传统仿真平台里用生成模型造场景测试规则逻辑。甚至可以不做完整VLA只把语言模块用作决策的辅助监控。把它们混为一谈会在技术选型时做出完全错误的判断——以为上了VLA就自然有了世界模型或者以为端到端必须靠世界模型才能跑。2.2 VLA为什么能在智驾中同时承担感知-预测-规划想问凭什么VLA能一肩挑感知、预测、规划三件事根本原因在于它把三件事统一到了一个共同的表达空间里语言和视觉的联合语义空间。感知结果可以用自然语言描述成“左前方有一辆白色SUV正在靠近车道线”预测结果可以表达成“该车有变道意图三秒内会占用本车道”规划动作则直接输出一个方向盘的转角值或者一组轨迹点。语言表达的重点不是“把结果念出来”而是把来自视觉的高维特征压缩成具备类人语义的低维表征让决策头更容易学到抽象规则。这种设计在实际使用中有几个直观的好处。第一是泛化VLA模型在预训练阶段见过大量“图片文字动作”的语料知道大卡车盲区大、雨天制动距离变长、跟在执行紧急任务的车辆后面要避让这些知识迁移到新场景时非常管用。第二是可干预性你可以在驾驶过程中下发“保持当前车道行驶”“两公里后切换到右侧车道”这类自然语言指令模型通过prompt调整行为模式这在传统端到端里很难做到。第三是可解释性模型在输出动作之前可以先生成一段对场景语义的理解安全员、评测系统都能拿这段语义来判断模型是不是“理解对了”。当然代价也很大。语言模型部分带来了额外的计算开销和延迟这在后面的工程坑里细说。2.3 世界模型如何反过来增强VLA和端到端系统如果VLA是那个做决策的“大脑”世界模型更像是大脑里负责模拟推演的那块区域以及实验室里用来训练大脑的“虚拟考场”。它从两个方向增强端到端系统。第一个方向是离线增强用世界模型生成大量真实感驾驶场景尤其是那些实车采集很难遇到的极端情况突然窜出的行人、多车交织的匝道、暴雨下的低能见度。过去这些场景要靠人工编写规则来构造成本高且逼真度不足。数据驱动的世界模型则可以从已有数据里学习道路结构、车辆动力学、交通参与者的交互模式然后大规模生成新的场景。这里特别值得关注的一个趋势是“能预测多智能体交互的世界模型”。早期很多世界模型只预测以自车为中心的下一帧画面对其他车的行为建模得很粗糙生成出来的场景里经常出现两辆车即将相撞却互不避让的荒谬画面。新一代多智能体世界模型把所有交通参与者放到一个统一的动态空间中联合建模每辆车的意图、轨迹、对他人行为的反应都彼此耦合这让基于世界模型的闭环回归测试第一次真正逼近了现实交互的复杂度。第二个方向是在线增强把世界模型作为一个“想象模块”嵌入决策过程。模型在规划时不直接选一个动作而是先在隐空间里推演几个候选动作分别会导致什么未来状态再挑一个安全性最高、舒适性最好的执行。这个思路源自模型强化学习里的latent imaginationDreamer系列是典型代表。放到智驾里它相当于给VLA加了一道“行为安全保险”在真正打方向盘之前先自己在脑子里把后续几秒的推演过一遍。不过这套框架目前在大规模智驾系统里还没到成熟量产阶段主要卡在对环境动态建模的精度上——真实交通的交互复杂程度远超目前隐空间模型能覆盖的范围。总的来说VLA和世界模型并不是竞争关系而是互补关系。VLA负责把视觉和语言的信息高效地转化为驾驶决策世界模型负责提供“对未来的预演能力”和“低成本的高质量训练场景”。二者结合才是一个真正能应对开放道路的端到端智驾系统。3. 智驾工程落地的三条真实路径与选型思考3.1 路径A模块化系统局部端到端现实主力在讨论火热的VLA和世界模型时一个容易被忽略的事实是当前量产车上的主力方案仍然是模块化系统加局部端到端。感知模型输出Free Space、目标物体、车道拓扑预测模型基于这些输出生成目标轨迹规划模块再结合自车状态求解轨迹最后控制模块执行。每个子模块内部可以是深度模型但模块之间仍然保留清晰的接口和规则化兜底。为什么这样设计三个原因。第一是安全冗余好做。感知出了问题规划有规则兜底预测置信度低规划可以退回保守策略。每个模块单独降级而不是整个系统一起失效。第二是可解释性可追踪。事故发生后工程师可以按链路逐级回放数据定位问题出在感知、预测还是决策这比在一个黑盒里找原因要高效得多。第三是训练数据要求低。每个子模块可以用专项数据进行优化不需要一次性准备好“图像到控制量”的海量闭环数据。我看到不少新成立的团队一上来就喊“全场景端到端”结果量产节点一压还是回到模块化路线。这不丢人局部端到端本身就是端到端落地的一种务实过渡。比如把感知和预测合并成可微的矢量化模型让预测头直接吃感知特征减少手工特征工程的损失这个方向量产价值很高风险也可控。3.2 路径B全场景端到端VLA上车VLA上车是接下来两三年最值得关注的变量。真正的视觉-语言-动作一体化模型理论上确实能用一套网络完成从传感器到控制量的全链路映射但目前还没有任何一家在量产车上完整落地。原因很现实模型太大车端跑不动。业内解决这个问题的主流思路可以分成三种。一种是离线蒸馏把大参数VLA在云端蒸馏成小参数模型再部署到车端语言理解能力压缩成近似版本控制性能尽量保持。一种是场景自适应路由默认情况下前端是一个快速的轨迹回归头在跑只有当语义场景复杂度超过阈值时才唤醒语言模型分支进行慢决策。这有点像人的快慢思考系统日常驾驶靠“肌肉记忆”复杂路口才调用“深思熟虑”。还有一种是混合部署车端只跑视觉编码器和动作头语言模型放在云端通过车联网请求语义帮助但这种方式又引入了网络延迟和断网风险只能用在低速泊车这类相对封闭的场景。无论哪种方案VLA上车后都必须保留一个独立的安全监控层。VLA输出的是建议轨迹安全层负责判断这条轨迹是否会导致碰撞、是否违反交规必要时直接接管。这是量产的基本底线也意味着“端到端”三个字在量产语境里从来不是“整条链路完全替代规则”而是“用可学习的模型占据主决策位置周围仍然保留可验证的护栏”。3.3 路径C世界模型驱动的验证闭环仿真先行我个人的判断是世界模型短期内最大的工程价值不在线上决策而在云端验证。传统仿真里构造场景靠的是规则脚本和人工摆放车辆效率低、场景覆盖有限、多智能体交互也不自然。世界模型可以学习大量真实驾驶数据里的场景分布自动生成高复杂度的测试场景尤其是那些需要多车博弈、行人穿插、突发遮挡的case。这个“仿真先行”的路径对任何端到端系统都是刚需。因为端到端系统部署前必须回答一个问题这模型在哪些场景下会突然失败开环评测回答不了这个问题实车路测又覆盖不了足够多的长尾case唯一可行的方式就是用生成式仿真在云端把模型试到“坏”。世界模型生成的多智能体交互场景恰恰能逼出模型在复杂博弈里的真实水平。比如生成一个“自车准备并入匝道后方车辆同时加速、相邻车道车辆缓慢让行”的三方博弈场景看在循环测试里VLA模型是顺利完成变道还是陷入犹豫。所以如果团队想引入世界模型我不建议一上来就做在线想象器而是先建一套云端的仿真回归系统用生成场景不断对端到端模型做压力测试。这套系统跑顺畅了再论述要不要把世界模型搬到车端。3.4 选型决策按数据规模、算力约束、安全冗余三条路径不是互斥关系实际推进时往往是组合拳。为了便于技术选型我列一个自己常用的小表格帮助快速对齐团队的资源禀赋和落地目标。维度模块化局部端到端全场景端到端VLA世界模型验证闭环数据要求中分模块专项数据极高需驾驶动作真值和语言场景描述中高需大规模真实场景做训练底料算力要求低-中现有域控可承载高车端推理压力大云端算力集中车端无感可解释性好逐级链路可追踪中可用语言中间状态增强较好可查看生成场景因果安全冗余成熟规则兜底完善需额外独立安全层辅助验证不直接参与决策适用阶段当前量产主力旗舰功能突破、高阶演示研发验证、评测体系升级选型的逻辑其实就三连问你手里的数据够不够喂VLA算力平台能不能撑起车端推理安全验收环节能不能接受黑盒决策三个都是“不够”那就别硬上全场景端到端先用局部端到端把体验做到位同时把世界模型仿真平台建起来等数据闭环跑通了再谈升级。4. 工程落地最容易被低估的三个坑4.1 坑一推理延迟与模型复杂度之间的平衡先说结论VLA在车端最大的矛盾不是精度低而是延迟高。一个标准的VLA模型视觉编码器几百毫秒能出特征但语言模型部分一旦做起token逐字解码延迟直接奔着几百毫秒去。放在高速驾驶场景里自车以120km/h行驶时每秒前进33米250毫秒延迟就意味着决策路径比理想状态下晚了8米以上这足以造成一次危险变道。我在部署团队的自研VLA模型时踩过一个大坑。最初的方案是把视觉特征和语言模型解码放在一起端到端推理本地测试精度都挺好一到车载开发板上就紧急拉胯。定位后发现瓶颈在attention机制的KV cache上车辆平台上的显存带宽根本喂不饱大规模attention计算。后来做了两步优化才算挽回来第一是视觉特征缓存每一帧图像送入视觉编码器后把特征缓存下来语言模块推理时不再重复计算视觉部分只更新增量token第二是动作单独解码控制量直接由动作头回归输出不再强制生成自然语言中间结果只有确需解释或复杂决策时才打开语言解码分支。这两步走完端到端延迟从400毫秒级别降到了100毫秒以内勉强跨过了安全线。如果团队刚起步我建议先做延迟预算再选模型。举个例子如果目标延迟是80毫秒你大概只有时间跑一个1亿参数左右的视觉编码器和一个小百亿参数的动作头语言模型部分大概率要放弃或者蒸馏成嵌入向量。车端量化也得提前排入计划INT8基本是标配INT4要看算子兼容性很多平台对某些attention算子的INT4支持并不完善一量化精度就崩。4.2 坑二开环评测很强闭环安评很弱这个坑几乎每个做端到端的人都撞过。论文里展示的开环指标——预测轨迹和人类真实轨迹的误差——可以做得非常漂亮因为开环评测只需要模型输出一条轨迹然后去和数据集里人类司机的真实轨迹做对比错了也只是分数难看一点。但一旦放进闭环仿真模型输出的轨迹会直接影响环境的下一个状态早先一步小小的偏差可能让车辆进入完全不同的态势随后错误被连环放大最终冲出道路或者撞上障碍物。这种“蝴蝶效应”复杂得多。应对方式是把评测体系做成金字塔形。最底层是开环指标包括轨迹误差、碰撞率、场景理解准确率这些只能用来快速筛选模型候选不能作为量产放行的依据。中间层是闭环仿真得分把模型放进世界模型或传统仿真器生成的场景里测试看驾驶得分、接管率、平均速度、舒适性指标这层是量产前最重要的关口。最顶层才是实车路测路测不是用来发现问题的而是用来确认仿真里已经解决的问题确实被解决了。我在搭建这套评测流程时学到的最有价值的一件事是“不要只看总分”。把一辆车在仿真里的失败case按场景参数聚类通常能发现某个速度区间或某个交互类型一直拖低分数。有一次我们发现在右转汇入场景里模型频繁犹豫原因是对右侧来车的预测置信度调得过于保守导致规划轨迹总在“抢行”和“等待”之间反复横跳。这种问题在看开环指标时根本暴露不了只有让模型在大量交互场景里闭环跑才能定位到是哪一环的预测策略出了问题。4.3 坑三数据管线中动作标签的获取与清洗很多从感知背景转过来做端到端的团队最容易低估数据管线的难度。感知模型要的标签是人画的框、线、点外包团队标一标就行。端到端模型要的标签是什么是一段连续场景里人类司机踩下的每一脚油门、每一度转向角。这种物理动作的真值不是标注员能画出来的而是要从采集车的CAN总线上直接记录。我们的数据管线里最核心的一条规则是采集即标注。车辆在真实道路上行驶时同步采集多路摄像头视频、毫米波雷达点云、IMU、方向盘转角、油门刹车踏板开度再通过高精时间同步机制把视频帧和控制量对齐。采集到的数据不能直接进训练集要经过多级清洗掉帧片段要剔除雨滴附着在镜头上的长片段要剔除维修路段里方向盘乱打的片段要剔除驾驶员风格过于激进或过于磨蹭的片段要通过策略分段采样控制比例防止模型学到某种极端驾驶风格。踩过最深的坑是时间同步误差。有一版数据在训练完评测时模型输出的转向角总有一帧左右的滞后车辆在直线行驶时一切正常一到过弯就出现轻微蛇形。查到最后发现是摄像头时间戳和CAN报文时间戳没有统一同步图像帧与方向盘转角之间存在几十毫秒的偏移模型学到的其实是“看到旧的画面、输出下一个时刻的动作”自然就慢了半拍。后来把所有采集车的时钟统一用GPS PPS同步并且在每次数据下线评审时都要做一轮图像帧和方向盘变化沿的对齐检查这个问题才算彻底解决。5. 给正在学习VLA和世界模型的同学的建议5.1 最小闭环学习路径从论文到工程“VLA论文精读”是当前自动驾驶圈高频出现的学习需求但很多同学一上来就啃VLA开源项目结果被代码里一堆分布式训练和RLHF的细节劝退。我的建议是别急着跑代码先按下面这条链路把概念串起来先读端到端驾驶的奠基文章理解“从图像到控制量”这个映射为什么成立比如Conditional Imitation Learning这类早期工作以及ChauffeurNet它们能帮你建立“行为克隆”和“轨迹生成”的基线认知。再看带中间结构的端到端模型UniAD和VAD是绕不开的。它们虽然不是VLA但能让你明白端到端并非只能做“黑盒”中间加入矢量化表示或BEV特征可以显著提升可解释性和规划稳定性。然后进入VLA主干论文RT-2为起点看它如何把动作离散化成token与语言token共用同一个输出空间接着看π0理解VLA如何扩展到更多动作形态再看自动驾驶垂直方向的视觉语言驾驶模型比如DriveVLM了解语言模块在驾驶决策里承担的具体职责。最后是世界模型部分从World Models这篇经典文章开始理解latent space里的环境建模再看DreamerV3体会“在想象中学习”如果关注驾驶仿真可以看GAIA-2和NVIDIA Cosmos这类大规模驾驶世界模型。工程向的实践不要落下。每读完一篇论文问自己一个问题如果让我在车端部署这个模型我会砍掉哪块结构、保留哪块把这个答案写下来比背作者结论有用得多。5.2 动手实践跑一个微型VLA/端到端Demo学习VLA和世界模型纸面分析远不够实操跑通一个端到端小demo很多概念会自动变清晰。这里分享一条我自己带人时反复用的最小实验路径。首选环境是CARLA0.9.14以上版本即可。第一步先用内置的自动驾驶模式采集1000到2000帧的前视图像和控制量真值覆盖红绿灯路口、直道、弯道三类基础场景图像统一缩放到小尺寸比如128x72减少训练开销。第二步把方向盘转角、油门、刹车离散化成11档左右的类别用预训练ResNet或EfficientNet提取图像特征再接一个GRU建模时序先做一个非VLA的端到端基线。第三步把这个基线的视觉编码器替换成轻量多模态模型比如LLaVA-Phi-3-mini这类将自然语言指令“前方红灯停车”“保持车道”当作另一个输入输出端改为离散动作token或直接回归控制量这样你就拥有一个可演示的微型VLA了。第四步在CARLA里更换天气条件和地图布局测试模型的指令跟随能力。你会很快发现训练数据里没覆盖的语义场景会让VLA的决策明显退化这时候再引入世界模型来扩大数据覆盖理解就会更深刻。过程中遇到模型瞎开不用慌首先要查的不是网络结构而是数据对齐和时间同步其次是数据多样性。很多人把精力花在调模型结构上到头来发现采集数据时驾驶风格单一模型只会开“教科书式”的路一遇到别人随意变道就直接懵圈。数据先乱但策略要稳先用小数据跑通链路再逐步加数据才是正路。5.3 关于“轮式机器人底盘VLA”的启发研究VLA时你一定会频繁看到“轮式机器人底盘VLA”这个方向这正是VLA跨形态泛化能力的绝佳展示。一个装备了摄像头和轮式底盘的机器人可以用自然语言接收指令比如“一分钟后停到右侧充电桩前”VLA模型理解视觉信息和语言指令后直接输出底盘左右轮的差速控制信号。这套映射关系和智驾里的横向纵向控制有着很高的同构性。这个方向的启发在于VLA并不天然绑定乘用车。如果你所在团队还没有乘用车数据完全可以先用轮式机器人底盘来做技术验证低速、封闭环境、数据采集成本低、安全性可控。在底盘机器人上把VLA部署、世界模型仿真评测、数据闭环这一套流程跑通再迁移到更高速度的车辆场景会平滑很多。这也是我判断很多智驾团队未来会走的路——先在低速场景验证新型模型架构再逐步向开放道路升级。回到VLA和世界模型的本质上这件事最核心的地方在于它们改变的不是某个算法模块而是整个智驾系统的开发范式。端到端给了你一条可以联合优化的链路VLA给了你一个可以用语言和指令来沟通的接口世界模型则给了你一副可以“脑补”未来并为之训练的大脑。三者真正落地背后的数据闭环、仿真评测、算力优化一个都不能少。如果让我给一个朴素的建议别因为哪个概念火就急着把所有产线推翻重来。先用世界模型做仿真验证用小场景跑通VLA闭环再把成熟能力逐步铺开到全场景。这个节奏看起来不够性感但它是把论文里那些激动人心的能力真正搬到车上的唯一稳妥路径。
返回列表