[论文解读] SurfelGAN: Synthesizing Realistic Sensor Data for Autonomous Driving
SurfelGAN 提出了一种数据驱动的方法,仅使用单次车辆通行的实时光电和相机数据,合成自动驾驶仿真中逼真的相机图像。该方法通过纹理表面元(textured surfels)重建场景,再利用生成对抗网络(GAN)生成新视角的高保真图像,显著提升了真实感,并实现了有效的数据增强以用于目标检测。
Autonomous driving system development is critically dependent on the ability to replay complex and diverse traffic scenarios in simulation. In such scenarios, the ability to accurately simulate the vehicle sensors such as cameras, lidar or radar is essential. However, current sensor simulators leverage gaming engines such as Unreal or Unity, requiring manual creation of environments, objects and material properties. Such approaches have limited scalability and fail to produce realistic approximations of camera, lidar, and radar data without significant additional work. In this paper, we present a simple yet effective approach to generate realistic scenario sensor data, based only on a limited amount of lidar and camera data collected by an autonomous vehicle. Our approach uses texture-mapped surfels to efficiently reconstruct the scene from an initial vehicle pass or set of passes, preserving rich information about object 3D geometry and appearance, as well as the scene conditions. We then leverage a SurfelGAN network to reconstruct realistic camera images for novel positions and orientations of the self-driving vehicle and moving objects in the scene. We demonstrate our approach on the Waymo Open Dataset and show that it can synthesize realistic camera data for simulated scenarios. We also create a novel dataset that contains cases in which two self-driving vehicles observe the same scene at the same time. We use this dataset to provide additional evaluation and demonstrate the usefulness of our SurfelGAN model.
研究动机与目标
- 解决在无需依赖游戏引擎中手动环境设计的情况下,构建可扩展、逼真的传感器仿真挑战。
- 克服传统仿真器在材料、几何结构和传感器模型方面需要大量手动配置的局限。
- 开发一种完全基于数据的流水线,利用真实世界传感器数据生成面向新车辆轨迹的高保真视觉输出。
- 通过合成多样化、逼真的真实场景视角,实现真实数据增强,以训练感知模型。
- 创建一个包含双车观测的新基准数据集,用于在真实多智能体条件下评估新视角合成效果。
提出的方法
- 利用增强的表面元表示法,从单次或多次自动驾驶车辆数据中重建三维场景,该表示法编码了几何、纹理、语义和外观信息。
- 使用表面元地图,从新自动驾驶车辆位姿和物体配置中渲染场景的新视角。
- 应用基于 GAN 的图像合成网络(SurfelGAN),将低保真度的表面元渲染结果转换为逼真图像。
- 通过结合真实图像、表面元渲染结果以及一种新型内部相机数据集,训练 SurfelGAN,优化目标为感知真实感和与真实图像的 L1 距离。
- 采用循环一致性损失和对抗性训练,以提升生成图像的质量并减少伪影。
- 将模型应用于数据增强,将真实数据中的 3D 检测框投影到 2D 新视角,用于检测器训练。
实验结果
研究问题
- RQ1基于数据驱动的方法是否能在无需手动环境创建的情况下,生成自动驾驶场景的逼真相机图像?
- RQ2基于表面元的场景重建与基于 GAN 的图像合成,在视觉质量和统计特性方面,能在多大程度上匹配真实传感器数据?
- RQ3与仅使用真实数据或仅使用表面元渲染相比,SurfelGAN 生成的数据在训练目标检测器时作为数据增强的有效性如何?
- RQ4该系统的失败模式是什么?重建误差或缺失几何结构如何影响图像合成质量?
- RQ5包含双车观测的新数据集是否能提升自动驾驶仿真中新型视角合成的评估效果?
主要发现
- 与表面元渲染相比,SurfelGAN 显著提升了图像真实感,降低了与真实图像的 L1 距离,并优于采用额外损失和数据的模型。
- SurfelGAN-S 变体(优化 L1 距离)的表现优于更复杂的模型(SA 和 SAC),证明了直接针对目标指标优化的有效性。
- 使用 SurfelGAN 生成图像进行数据增强,使车辆检测器的平均精度提升了 3.5 个百分点(AP@50 从 21.9% 提升至 25.4%),相较于仅使用真实数据训练。
- SurfelGAN 生成的图像使 AP@75 提升 1.3%(从 10.8% 提升至 12.1%),平均 AP 提升 1.1%(从 11.9% 提升至 13.0%),显示出强大的实际应用价值。
- 失败案例揭示了重建质量的局限性,特别是在未映射区域或存在大几何误差的区域,GAN 难以合理“幻觉”出逼真的纹理。
- 所提出的包含双车观测的数据集支持对新型视角合成的可靠评估,为未来自动驾驶仿真研究提供了新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。