[论文解读] GeoSim: Realistic Video Simulation via Geometry-Aware Composition for Self-Driving
GeoSim 提出了一种几何感知的视频仿真框架,通过将从传感器数据中提取并以新姿态渲染的逼真3D动态物体合成到现有城市场景中,生成具有照片级真实感、几何一致性以及交通感知特性的合成视频。该方法通过数据增强将语义分割性能提升了3.4% mIOU,实现了最先进的感知质量。
Scalable sensor simulation is an important yet challenging open problem for safety-critical domains such as self-driving. Current works in image simulation either fail to be photorealistic or do not model the 3D environment and the dynamic objects within, losing high-level control and physical realism. In this paper, we present GeoSim, a geometry-aware image composition process which synthesizes novel urban driving scenarios by augmenting existing images with dynamic objects extracted from other scenes and rendered at novel poses. Towards this goal, we first build a diverse bank of 3D objects with both realistic geometry and appearance from sensor data. During simulation, we perform a novel geometry-aware simulation-by-composition procedure which 1) proposes plausible and realistic object placements into a given scene, 2) render novel views of dynamic objects from the asset bank, and 3) composes and blends the rendered image segments. The resulting synthetic images are realistic, traffic-aware, and geometrically consistent, allowing our approach to scale to complex use cases. We demonstrate two such important applications: long-range realistic video simulation across multiple camera sensors, and synthetic data generation for data augmentation on downstream segmentation tasks. Please check https://tmux.top/publication/geosim/ for high-resolution video results.
研究动机与目标
- 解决自动驾驶系统中缺乏可扩展、逼真且物理一致的视频仿真问题。
- 通过利用真实驾驶车队的大规模传感器数据,消除对手动创建3D资产的需求。
- 实现在现有场景中无缝插入动态物体(如车辆),确保遮挡、光照和空间一致性正确。
- 展示合成数据在提升语义分割等下游感知任务性能方面的实用性。
- 在多个摄像机传感器上实现高保真度的逼真感和几何保真度。
提出的方法
- 利用具有形状正则化的可微重建网络,从多视角、多传感器数据(激光雷达、摄像头)中构建大规模3D资产库。
- 结合高清地图和激光雷达,推断场景中合理的3D物体位置,确保交通感知和物理上合理的定位。
- 通过基于图像的渲染与神经图像修复技术处理遮挡、光照变化和边界融合,实现无缝合成。
- 采用混合渲染流水线,结合基于物理的渲染与神经图像修复,提升真实感的同时保持效率。
- 通过传播物体姿态并在多个摄像机传感器上渲染新视角,生成时序一致的视频序列。
- 将合成数据用于语义分割中的数据增强,在真实数据上微调模型时加入额外的合成样本。
实验结果
研究问题
- RQ1基于数据驱动且具备几何感知能力的合成方法,能否生成在感知上与真实画面无法区分的合成驾驶视频?
- RQ23D场景布局与动态物体定位的整合,在视频仿真中如何提升真实感与几何一致性?
- RQ3GeoSim 生成的合成数据在多大程度上能提升下游感知模型(如语义分割)的性能?
- RQ4尽管FID分数提升有限,阴影渲染与混合渲染对感知真实感的相对贡献如何?
- RQ5GeoSim 是否能在不重新训练的情况下泛化到不同数据集和城市环境?
主要发现
- 在感知质量评估中,GeoSim 的人类偏好得分为94.3%,显著优于 SPADE、Guided Editing 和 CAD 等基线方法。
- GeoSim 的 FID 得分为14.3,低于所有基线方法,表明其与真实数据的分布相似性更优。
- 在渲染流程中加入阴影可使人类偏好从71.9%提升至—(隐含提升),尽管 FID 保持不变(14.3),凸显了人类感知与 FID 指标之间的差距。
- 在 Argoverse 数据集上,GeoSim 的人类偏好得分为84.0%(优于 CAD),FID 为24.5,表明其在跨数据集场景下具有强大泛化能力。
- 使用 GeoSim 进行数据增强后,PSPNet 的 mIOU 提升了3.4%,DeepLabv3 的 mIOU 提升了0.4%,且在两种分割模型上均取得一致增益。
- 该方法减少了先前方法中常见的模糊车辆和几何不一致等伪影,通过神经图像修复与遮挡处理实现了无缝融合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。