[论文解读] MARS: An Instance-aware, Modular and Realistic Simulator for Autonomous Driving
MARS 是一种新颖的开源基于 NeRF 的自动驾驶仿真器,通过分别建模前景物体和背景环境,实现了实例感知、模块化和逼真的场景渲染。它在图像真实感方面达到最先进水平(V-KITTI 上 PSNR 为 28.37),并通过其模块化架构支持对物体轨迹和外观的灵活编辑,该架构支持可互换的神经辐射场主干网络和采样策略。
Nowadays, autonomous cars can drive smoothly in ordinary cases, and it is widely recognized that realistic sensor simulation will play a critical role in solving remaining corner cases by simulating them. To this end, we propose an autonomous driving simulator based upon neural radiance fields (NeRFs). Compared with existing works, ours has three notable features: (1) Instance-aware. Our simulator models the foreground instances and background environments separately with independent networks so that the static (e.g., size and appearance) and dynamic (e.g., trajectory) properties of instances can be controlled separately. (2) Modular. Our simulator allows flexible switching between different modern NeRF-related backbones, sampling strategies, input modalities, etc. We expect this modular design to boost academic progress and industrial deployment of NeRF-based autonomous driving simulation. (3) Realistic. Our simulator set new state-of-the-art photo-realism results given the best module selection. Our simulator will be open-sourced while most of our counterparts are not. Project page: https://open-air-sun.github.io/mars/.
研究动机与目标
- 为解决自动驾驶中罕见且高风险的边缘情况仿真问题,同时将模拟到现实的域差距降至最低。
- 克服现有仿真器在动态场景中缺乏实例级控制和逼真度的局限性。
- 开发一种模块化框架,支持多样化 NeRF 主干网络、采样策略和输入模态的灵活集成,以实现可扩展的研究与部署。
- 提供一个开源平台,支持实例编辑和逼真传感器仿真,以提升算法训练效果。
提出的方法
- 该仿真器将场景分解为一个背景节点和多个前景节点,每个节点均使用独立的神经辐射场进行建模,以实现对静态和动态属性的独立控制。
- 通过射线-盒子相交检测确定可见性,并在查询节点表示前,将射线通过与实例相关的坐标系进行处理。
- 前景节点采用基于类别的 NeRF 表示,并使用学习到的嵌入向量表示实例特定属性,而背景则使用基于网格或 MLP 的 NeRF 来建模场景几何结构。
- 模块化设计支持主干网络(例如:基于网格、MLP)、采样器(例如:提议采样、粗到精采样)以及监督信号(例如:深度、语义、天空损失)的即插即用式选择。
- 系统通过组合沿每条射线可见的所有节点的采样结果,生成 RGB 图像、深度图和语义掩码。
- 训练采用多模态输入进行监督,包括 RGB 图像、位姿、3D 框体以及可选的深度图和分割掩码。
实验结果
研究问题
- RQ1基于 NeRF 的仿真器是否能在支持实例级编辑的同时,实现自动驾驶仿真中的最先进逼真度?
- RQ2NeRF 组件(主干网络、采样器、监督信号)的模块化设计如何影响渲染质量和灵活性?
- RQ3对动态车辆和静态背景进行实例感知建模,在多大程度上能提升模拟到现实的泛化能力?
- RQ4所提出的框架在公开基准测试中是否在真实感和可控性方面优于现有仿真器?
主要发现
- 所提出的 MARS 框架在 V-KITTI 基准测试中实现了最先进水平的 PSNR(28.37)和 SSIM(0.907),显著优于先前方法。
- 消融研究证实,采用默认设置(基于网格的背景、类别级前景、粗到精采样)可获得最佳性能,在 KITTI 上 PSNR 为 25.04,在 V-KITTI 上为 28.37。
- 引入天空损失和深度监督可提升渲染质量,在 V-KITTI 上相比基线设置使 LPIPS 降低 0.046。
- 模块化设计支持有效的消融实验与对比,最佳配置相比非模块化基线实现了 2.5–3.5 dB 的 PSNR 提升。
- 成功演示了实例编辑功能,包括车辆移除、添加和轨迹修改,结果具有高度视觉真实性。
- 尽管真实感极高,但训练耗时数小时,且不支持实时推理;反射表面上的动态高光效应仍是当前局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。