Skip to main content
QUICK REVIEW

[论文解读] ADriver-I: A General World Model for Autonomous Driving

Fan Jia, Weixin Mao|arXiv (Cornell University)|Nov 22, 2023
Multimodal Machine Learning Applications被引用 7
一句话总结

本文提出 ADriver-I,一种用于自动驾驶的通用世界模型,通过多模态大语言模型(MLLMs)和视频扩散模型(VDMs),统一视觉-动作预测与未来场景生成。通过利用交错的视觉-动作配对,ADriver-I 以自回归方式预测控制信号并生成未来帧,形成闭环,实现在模拟世界中的自维持驾驶,速度的 L1 控制误差为 0.072 m/s,方向盘转角的 L1 控制误差为 0.091 rad,FID 和 FVD 分数分别为 5.52 和 97.0。

ABSTRACT

Typically, autonomous driving adopts a modular design, which divides the full stack into perception, prediction, planning and control parts. Though interpretable, such modular design tends to introduce a substantial amount of redundancy. Recently, multimodal large language models (MLLM) and diffusion techniques have demonstrated their superior performance on comprehension and generation ability. In this paper, we first introduce the concept of interleaved vision-action pair, which unifies the format of visual features and control signals. Based on the vision-action pairs, we construct a general world model based on MLLM and diffusion model for autonomous driving, termed ADriver-I. It takes the vision-action pairs as inputs and autoregressively predicts the control signal of the current frame. The generated control signals together with the historical vision-action pairs are further conditioned to predict the future frames. With the predicted next frame, ADriver-I performs further control signal prediction. Such a process can be repeated infinite times, ADriver-I achieves autonomous driving in the world created by itself. Extensive experiments are conducted on nuScenes and our large-scale private datasets. ADriver-I shows impressive performance compared to several constructed baselines. We hope our ADriver-I can provide some new insights for future autonomous driving and embodied intelligence.

研究动机与目标

  • 通过将感知、规划与控制统一为单一端到端框架,克服传统模块化自动驾驶流水线中的冗余与误差传播问题。
  • 通过基于预测控制信号生成未来场景,实现在无高精地图或 3D 框架先验条件下的模拟世界自动驾驶。
  • 开发一种可泛化的世界模型,利用交错的视觉-动作配对,在自洽的闭环环境中实现长时程驾驶。
  • 通过训练期间的多轮监督提升控制信号预测精度,减少序列决策中的累积误差。

提出的方法

  • 引入交错的视觉-动作配对,将视觉特征与控制信号(如方向盘转角、速度)统一为适合 MLLM 处理的类似文本的标记格式。
  • 利用多模态大语言模型(MLLM)基于历史视觉-动作配对和当前视觉标记,自回归地预测当前控制信号。
  • 将视频扩散模型(VDM)基于预测的控制信号和历史视觉-动作配对进行条件化,以生成未来视频帧。
  • 在闭环中重复该过程:预测的控制信号影响未来场景的生成,而生成的场景又反过来为下一次控制预测提供信息。
  • 在训练期间采用多轮对话式监督,以提升中间动作预测的准确性并减少累积误差。
  • 在联合框架中分别训练 MLLM 和 VDM 组件,实现合成世界中自动驾驶的端到端模拟。

实验结果

研究问题

  • RQ1基于 MLLM 和 VDM 的统一世界模型是否能在不依赖模块化流水线的情况下实现准确的控制信号预测?
  • RQ2基于预测控制信号的未来场景生成是否能有效实现模拟环境中自洽的自动驾驶?
  • RQ3训练期间的多轮监督如何影响序列控制信号预测的准确性和稳定性?
  • RQ4该模型在缺乏高精地图或 3D 框架先验知识的条件下,能在多大程度上生成高保真度的未来帧?
  • RQ5该模型是否能通过递归生成未来状态和动作,在闭环方式下实现长时程驾驶?

主要发现

  • 当提供三个历史视觉-动作配对时,ADriver-I 在速度预测上的 L1 误差为 0.072 m/s,在方向盘转角预测上的 L1 误差为 0.091 rad。
  • 模型生成未来四帧的 Fréchet Video Distance(FVD)为 97.0,Fréchet Inception Distance(FID)为 5.52,表明其在无高精地图或框体先验条件下仍能实现高质量生成。
  • 多轮监督显著降低了控制预测中的累积误差,在速度和方向盘转角预测精度上均优于单轮监督和时序融合基线方法。
  • 定性结果表明,预测的控制信号直接影响场景生成,而生成的场景又引导后续动作,从而在合成世界中实现闭环自动驾驶。
  • 该模型成功在自生成环境中实现长时程驾驶,如图 7 所示,证明了在模拟世界中实现无限驾驶的可行性。
  • 尽管性能表现强劲,该模型在快速控制变化条件下仍面临生成高质量帧的挑战,且 MLLM 与 VDM 的独立训练限制了端到端优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。