[论文解读] LOPR: Latent Occupancy PRediction using Generative Models
LOPR 提出了一种新颖的潜在占据预测框架,通过基于 VAE-GAN 的生成模型和基于 Transformer 的预测器,在学习到的潜在空间中将表征学习与随机场景预测解耦。该方法在 NuScenes、Waymo Open 和自定义数据集上实现了最先进性能,通过联合条件化 LiDAR、RGB 相机和高清地图输入,无需人工标注。
Environment prediction frameworks are integral for autonomous vehicles, enabling safe navigation in dynamic environments. LiDAR generated occupancy grid maps (L-OGMs) offer a robust bird's eye-view scene representation that facilitates joint scene predictions without relying on manual labeling unlike commonly used trajectory prediction frameworks. Prior approaches have optimized deterministic L-OGM prediction architectures directly in grid cell space. While these methods have achieved some degree of success in prediction, they occasionally grapple with unrealistic and incorrect predictions. We claim that the quality and realism of the forecasted occupancy grids can be enhanced with the use of generative models. We propose a framework that decouples occupancy prediction into: representation learning and stochastic prediction within the learned latent space. Our approach allows for conditioning the model on other available sensor modalities such as RGB-cameras and high definition maps. We demonstrate that our approach achieves state-of-the-art performance and is readily transferable between different robotic platforms on the real-world NuScenes, Waymo Open, and a custom dataset we collected on an experimental vehicle platform.
研究动机与目标
- 解决基于网格单元的确定性占据预测模型存在的局限性,这些模型会产生模糊、不真实的输出,并且无法建模场景级的随机性。
- 通过实现从原始传感器输入端到端的自监督学习,克服轨迹预测框架对人工标注数据的依赖。
- 通过将表征学习与特定任务的预测解耦,实现跨机器人平台的鲁棒且可迁移的场景预测。
- 通过建模不确定性并利用多模态输入(LiDAR、RGB、高清地图),提升未来占据网格图的现实感与准确性。
提出的方法
- 将占据预测分解为两个阶段:(1) 通过在多模态传感器数据(LiDAR、RGB、高清地图)上训练的 VAE-GAN 模型进行表征学习;(2) 在学习到的潜在空间中进行随机预测。
- 训练 VAE-GAN 以学习场景的解耦、低维潜在表征,同时保留空间和语义结构。
- 使用基于 Transformer 的解码器,根据潜在码和多模态上下文生成随机的未来占据预测。
- 将预测网络条件化于 LiDAR 占据网格、RGB 图像和高清地图,以提升场景理解与泛化能力。
- 通过在未标注的传感器数据序列上使用自监督的序列到序列学习,实现端到端优化。
- 应用重参数化与变分推断,以实现可微采样并支持通过随机预测的反向传播。
实验结果
研究问题
- RQ1从多模态传感器数据中学习到的解耦潜在空间是否能提升未来占据网格预测的现实感与准确性?
- RQ2与端到端的基于网格的模型相比,将表征学习与预测解耦是否能实现更好的泛化能力与跨机器人平台的可迁移性?
- RQ3在潜在空间中进行随机预测是否能在场景级现实感与不确定性建模方面优于确定性预测?
- RQ4该框架在部分观测与遮挡条件下,能在多大程度上利用 RGB 和高清地图输入来提升预测性能?
- RQ5该框架能否作为下游监督任务(如轨迹预测)的预训练目标?
主要发现
- LOPR 在 NuScenes、Waymo Open 和自定义真实世界数据集上均实现了最先进性能,优于先前的 L-OGM 和视频预测模型。
- 在 NuScenes 数据集中,LOPR 的完整多模态条件化(LiDAR、RGB、高清地图)随机变体在 3 秒预测时域内达到 0.61 mIoU,显著优于确定性基线模型。
- LOPR 生成的预测结果真实且多样化,能够正确传播移动目标并保持静态场景细节,即使在对向车辆和非典型道路形状等复杂场景中亦然。
- 该框架成功推断出场景中此前未观测到的移动目标(如对向车辆),展示了强大的泛化能力与不确定性建模能力。
- LOPR 在不同平台间表现出强大的可迁移性,仅需极少微调即可部署于多种机器人系统。
- 定性结果表明,即使在真实情况未完全观测时,LOPR 也能生成合理的场景变化,包括遮挡推理与动态交互。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。