Skip to main content
QUICK REVIEW

[论文解读] CVAE-H: Conditionalizing Variational Autoencoders via Hypernetworks and Trajectory Forecasting for Autonomous Driving

Geunseob Oh, Huei Peng|arXiv (Cornell University)|Jan 24, 2022
Autonomous Vehicle Technology and Safety被引用 5
一句话总结

CVAE-H 提出了一种基于超网络增强的条件变分自编码器,实现了自动驾驶场景下概率性、多模态、上下文驱动且通用的轨迹预测。通过使用超网络从高维场景特征(如 LiDAR、地图、轨迹)中条件性地生成 VAE 权重,该方法在 PRECOG-Carla town01 基准测试中实现了最先进性能,最小平均位移误差(minMSD)为 0.312,优于大多数生成模型,同时保持了不确定性量化能力。

ABSTRACT

The task of predicting stochastic behaviors of road agents in diverse environments is a challenging problem for autonomous driving. To best understand scene contexts and produce diverse possible future states of the road agents adaptively in different environments, a prediction model should be probabilistic, multi-modal, context-driven, and general. We present Conditionalizing Variational AutoEncoders via Hypernetworks (CVAE-H); a conditional VAE that extensively leverages hypernetwork and performs generative tasks for high-dimensional problems like the prediction task. We first evaluate CVAE-H on simple generative experiments to show that CVAE-H is probabilistic, multi-modal, context-driven, and general. Then, we demonstrate that the proposed model effectively solves a self-driving prediction problem by producing accurate predictions of road agents in various environments.

研究动机与目标

  • 解决在多样化城市环境中预测道路参与者随机性、多模态行为的挑战,以支持自动驾驶车辆的决策。
  • 开发一种概率性、多模态、上下文驱动(融合社会与空间特征)且在不同驾驶场景中具备泛化能力的预测模型。
  • 通过引入基于超网络的条件化机制,克服传统条件 VAE 依赖固定嵌入层所导致的信息流动受限与高维输入扩展性差的问题,提升信息流动效率与模型可扩展性。
  • 证明所提出的模型无需针对特定场景进行微调,即可在未见过的城市配置中实现泛化,具备在真实场景中部署的潜力。

提出的方法

  • 将超网络集成到条件变分自编码器(CVAE)中,基于高维上下文输入(如 LiDAR 点云、高清地图、标注轨迹)动态生成 VAE 的编码器与解码器权重。
  • 利用超网络动态生成 VAE 的所有参数(如权重与偏置),实现端到端可微分,提升上下文信息在所有网络层间的流动效率。
  • 通过超网络输出,将 VAE 同时条件化于空间特征(如车道结构、停车标志、人行横道)与社会特征(如周围参与者之间的相对位置与速度)。
  • 采用重参数化技巧的变分推断目标进行训练,通过优化证据下界(ELBO)实现高效的反向传播。
  • 将输出预测表示为高斯混合模型(GMM),以支持不确定性量化并实现多模态轨迹生成。
  • 通过利用超网络生成复杂、任务特定的网络权重的能力,实现对高维输入的扩展,而无需增加模型深度或宽度。

实验结果

研究问题

  • RQ1基于超网络的条件化机制是否能够提升条件 VAE 在高维轨迹预测任务中的表达能力与可扩展性?
  • RQ2CVAE-H 是否能有效捕捉多样化城市驾驶环境中的空间与社会上下文信息,从而生成上下文驱动的多模态预测?
  • RQ3在基准数据集上,CVAE-H 与最先进模型相比,在预测准确率与不确定性量化方面表现如何?
  • RQ4CVAE-H 在无需微调或场景特定适配的情况下,其泛化能力在多大程度上覆盖未见过的驾驶场景?

主要发现

  • 在 PRECOG-Carla town01 测试集上,CVAE-H 在 K=12 条轨迹样本下的最小平均位移误差(minMSD)为 0.312,优于大多数生成模型,包括 Social-GAN(1.464)、R2P2(0.843)和 DESIRE(2.599)。
  • 尽管是概率性模型且具备生成多样化多模态预测的能力,CVAE-H 的性能仍与确定性模型 MFP(minMSD 为 0.279)相当,表现优异。
  • CVAE-H 成功捕捉了排队动态:预测显示队列前方的车辆可能前进(x 方向不确定性延长),而队列后方的车辆保持静止,体现了上下文感知行为。
  • 模型具备跨环境泛化能力:定性结果表明,使用单一训练模型,可在不同配置(如不同队列长度)下持续生成与场景相符的预测。
  • 采用高斯混合模型(GMM)输出层,实现了不确定性量化,为预测轨迹提供概率分布,这对下游规划模块至关重要。
  • CVAE-H 展现出强大的泛化能力:在场景中所有五个参与者上均生成了准确、多样化且符合上下文的预测,各参与者最小平均位移误差(minMSD)介于 0.151(Car 1)至 0.404(Car 5)之间,全部低于基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。