Skip to main content
QUICK REVIEW

[论文解读] Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion

Lunjun Zhang, Yuwen Xiong|arXiv (Cornell University)|Nov 2, 2023
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

该论文提出 Copilot4D,一种用于自动驾驶的新型无监督世界建模框架,采用 VQVAE 对点云观测进行分词处理,并结合改进的掩码生成图像变换器(Masked Generative Image Transformer)实现离散扩散,以支持可扩展的并行解码。该方法在 NuScenes、KITTI 和 Argoverse2 数据集上实现了最先进性能,将 1 秒和 3 秒未来点云预测的 Chamfer 距离分别降低超过 65% 和 50%。

ABSTRACT

Learning world models can teach an agent how the world works in an unsupervised manner. Even though it can be viewed as a special case of sequence modeling, progress for scaling world models on robotic applications such as autonomous driving has been somewhat less rapid than scaling language models with Generative Pre-trained Transformers (GPT). We identify two reasons as major bottlenecks: dealing with complex and unstructured observation space, and having a scalable generative model. Consequently, we propose Copilot4D, a novel world modeling approach that first tokenizes sensor observations with VQVAE, then predicts the future via discrete diffusion. To efficiently decode and denoise tokens in parallel, we recast Masked Generative Image Transformer as discrete diffusion and enhance it with a few simple changes, resulting in notable improvement. When applied to learning world models on point cloud observations, Copilot4D reduces prior SOTA Chamfer distance by more than 65% for 1s prediction, and more than 50% for 3s prediction, across NuScenes, KITTI Odometry, and Argoverse2 datasets. Our results demonstrate that discrete diffusion on tokenized agent experience can unlock the power of GPT-like unsupervised learning for robotics.

研究动机与目标

  • 为解决由于复杂且非结构化的观测空间以及缺乏可扩展生成模型,导致无监督世界建模在自动驾驶中难以扩展的瓶颈问题。
  • 通过结合分词与离散扩散,实现机器人智能体上的类似 GPT 的无监督学习。
  • 直接从原始 LiDAR 观测中实现高质量、多样化且准确的未来点云预测,无需任何监督。
  • 通过建模不同自车轨迹下未来场景的变化,支持反事实推理。
  • 证明在分词观测上使用离散扩散可实现可扩展、通用的世界理解,从而赋能机器人智能体。

提出的方法

  • 使用带有隐式体素渲染解码器的 VQVAE 对原始 LiDAR 点云观测进行分词处理,以学习离散潜在表征。
  • 通过在反向过程中去噪掩码分词,应用离散扩散模型生成未来点云分词。
  • 将掩码生成图像变换器(MaskGIT)重构为离散扩散框架,实现在保持自回归质量的同时并行解码多个分词。
  • 采用具有交错空间(鸟瞰图,BEV)和时间块的 Transformer 架构,以建模分词世界状态中的时空依赖关系。
  • 在推理过程中采用 top-3 分类采样,以提升生成的多样性与质量,类似于语言模型的做法。
  • 将扩散过程条件化于过去观测和未来自车位姿,以生成动作条件化的未来预测。

实验结果

研究问题

  • RQ1在 VQVAE 嵌入的点云上使用离散扩散,能否在自动驾驶的无监督未来点云预测任务中实现最先进性能?
  • RQ2VQVAE 分词与离散扩散的结合,能否实现复杂 3D 场景动态的可扩展、并行且高保真度的生成?
  • RQ3该世界模型能否学习多模态未来结果,并对反事实自车行为作出恰当反应?
  • RQ4在多样化的驾驶基准测试中,该方法在 Chamfer 距离指标上与先前最先进方法相比,其量化性能如何?
  • RQ5该模型在多大程度上能“想象”新车辆进入场景,或预测周围智能体的反应行为?

主要发现

  • 在 NuScenes、KITTI Odometry 和 Argoverse2 数据集上,该方法将 1 秒未来点云预测的 Chamfer 距离降低了 65% 至 75%。
  • 对于 3 秒预测,与先前最先进方法相比,Chamfer 距离的相对改进超过 50%,表明其具备强大的长时序泛化能力。
  • 定性结果表明,该模型能够生成多样且合理的多未来预测,准确捕捉车辆交互与运动模式等场景动态。
  • 当输入反事实自车轨迹时,该模型能成功想象出一致的替代未来,包括为避免碰撞而刹车等反应行为。
  • 失败案例揭示了在预测新车辆进入场景以及建模长时序动态方面仍存在局限,这些局限主要归因于数据和模型规模限制,而非架构缺陷。
  • 消融实验表明,结合 top-3 采样与改进的 MaskGIT 架构的离散扩散方法,相比基线自回归或非扩散方法,显著提升了生成质量与多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。