导语:自动驾驶正在从“感知、预测、规划分别建模”的模块化架构,转向以神经网络统一完成环境理解与轨迹生成的端到端路线。与此同时,世界模型开始承担“预测未来、生成场景、评估动作”的角色。两条技术路线正在加速融合:端到端模型负责驾驶,世界模型负责想象和验证,从而提升系统对复杂交通与长尾场景的适应能力。
世界模型:让车辆具备“预演未来”的能力
自动驾驶世界模型通过学习道路环境的空间结构、交通参与者运动规律以及车辆动作带来的后果,预测未来若干时刻可能出现的状态。与只识别当前画面的感知模型不同,它更关注“如果车辆采取某个动作,接下来会发生什么”。世界模型既可以在图像空间生成未来视频,也可以在鸟瞰图或压缩后的潜空间中预测环境变化。
早期研究主要验证驾驶视频生成与条件控制能力,近年来则逐步转向安全测试和闭环仿真。例如,Wayve公布的GAIA系列可根据视频、文本和车辆动作生成可控驾驶场景;2026年8月发布的GAIA-4进一步把端到端驾驶模型置于生成环境中,使模型的决策能够改变下一时刻的观测,从而形成闭环评估。NVIDIA Cosmos相关模型也在探索多视角驾驶数据生成、长尾场景合成和物理世界推理。[1] [2]
端到端驾驶:从直接模仿走向规划导向
传统端到端驾驶通常把摄像头等传感器输入直接映射为方向盘、油门和制动控制量,链路简洁,但容易出现行为不可解释、训练数据分布受限和误差难定位等问题。当前主流方案更强调“规划导向”:模型输出多条候选轨迹、轨迹概率或未来航点,再由安全约束、评分网络或控制器完成选择和执行。
这意味着“端到端”不再等同于完全取消中间表示。鸟瞰图、稀疏目标向量、三维几何特征和道路拓扑仍可作为可学习表示参与训练,关键在于感知信息是否围绕最终驾驶目标联合优化。2026年的相关综述也指出,评价现代端到端系统时,应同时考察输入表示、规划输出、监督信号和评测协议,而不能只看轨迹位移误差。[3]
融合趋势:预测、推理与动作进入统一闭环
最新进展是把视觉、语言、动作和世界预测放入统一框架。视觉语言动作模型能够利用语言表达交通规则、导航意图和场景语义;世界模型则负责生成动作对应的未来结果。CVPR 2026 Findings收录的VLA-World采用“先生成可行轨迹、再想象下一帧、最后依据想象结果修正轨迹”的流程,体现了从被动模仿到主动预演的变化。[4]
另一类方法不生成高清图像,而是在低维潜空间或鸟瞰图中预测未来,以降低延迟。World4Drive利用潜空间世界模型生成并评估多模态规划轨迹;WoTE则预测未来鸟瞰状态,用于在线比较候选轨迹。这类方案更接近车端实时部署需求,也说明世界模型的价值并不取决于画面是否逼真,而在于能否准确支持决策。[5] [6]
评测体系正在成为技术竞争焦点
仅在历史数据上比较预测轨迹与人工轨迹,无法充分说明车辆进入交互环境后的安全性。NAVSIM采用真实数据与非反应式仿真结合的方式,综合考察行驶进度、碰撞风险、道路合规和舒适性;更完整的闭环仿真则允许车辆动作持续改变环境。未来评测需要覆盖开环回放、伪仿真、闭环仿真和真实道路测试,并明确不同方法的适用边界。[7] [8]
仍需解决的关键问题
- 未来预测不确定性:交通场景具有多种合理演化方向,模型必须表达概率与风险,而不是只生成单一未来。
- 物理一致性:视觉上逼真的视频不一定满足车辆动力学、遮挡关系和交通规则。
- 长尾数据闭环:合成场景应经过筛选、验证和再训练,避免把生成偏差引入驾驶策略。
- 实时性与安全冗余:大模型需要在车规算力、低延迟和故障降级条件下稳定运行。
- 可解释评估:系统不仅要给出轨迹,还应说明候选轨迹为何安全、风险来自何处。
总结
世界模型与端到端驾驶正在形成互补关系:前者提供未来预测、场景生成和动作评估,后者把感知信息直接转化为驾驶行为。当前技术重心已经从单纯扩大模型和数据规模,转向规划导向架构、视觉语言动作融合、潜空间预测以及闭环安全验证。真正决定落地速度的,不只是模型能否“开车”,而是它能否在可验证、可复现和可约束的体系中持续证明自己开得安全。