[论文解读] Semantic Road Layout Understanding by Generative Adversarial Inpainting
本文提出一种基于生成对抗网络(GAN)的语义修复模型,通过从语义分割图中移除动态物体,而非RGB图像,来重建被遮挡的道路布局。与基于RGB图像的修复方法及语义分割基线相比,该方法在恢复静态场景结构(尤其是道路和人行道)方面表现出更优的准确性,证明直接进行语义修复优于图像到图像的转换方法,在自动驾驶场景理解中更具优势。
Autonomous driving is becoming a reality, yet vehicles still need to rely on complex sensor fusion to understand the scene they act in. The ability to discern static environment and dynamic entities provides a comprehension of the road layout that poses constraints to the reasoning process about moving objects. We pursue this through a GAN-based semantic segmentation inpainting model to remove all dynamic objects from the scene and focus on understanding its static components such as streets, sidewalks and buildings. We evaluate this task on the Cityscapes dataset and on a novel synthetically generated dataset obtained with the CARLA simulator and specifically designed to quantitatively evaluate semantic segmentation inpaintings. We compare our methods with a variety of baselines working both in the RGB and segmentation domains.
研究动机与目标
- 解决在车辆和行人等动态物体遮挡下,理解自动驾驶中静态道路布局的挑战。
- 开发一种新型语义修复模型,直接从分割图而非RGB图像中重建缺失的场景结构。
- 在真实数据集(Cityscapes)和合成数据集(CARLA生成)上评估该方法,以确保鲁棒性与可量化评估。
- 证明语义修复优于基于RGB图像的修复和标准语义分割流程,在保持道路布局结构准确性方面表现更优。
- 通过从部分遮挡视图中恢复具有物理约束的场景布局,提升轨迹规划与障碍物避让的可靠性。
提出的方法
- 该方法采用条件生成对抗网络(conditional GAN)架构,训练其在语义分割图的掩码区域上进行修复,利用周围静态类别的上下文信息。
- 通过预训练的DeepLab-v3+模型在RGB图像上生成动态物体掩码,进而用于定义分割图中的修复区域。
- 生成器通过关注语义上下文来学习重建合理的空间布局,判别器则确保预测类别的分布具有真实性。
- 模型在Cityscapes和使用CARLA模拟器生成的新颖合成数据集上进行端到端训练,并采用类别感知损失函数。
- 评估了两种流程变体:直接在分割图上进行修复,以及先对RGB图像进行修复再进行分割。
- 该方法利用语义图的结构一致性,避免了RGB修复中常见的基于纹理的重建误差。
实验结果
研究问题
- RQ1基于GAN的模型能否有效从语义分割图而非RGB图像中重建被遮挡的道路布局?
- RQ2与先对RGB图像进行修复再分割的方法相比,直接语义修复在结构准确性和布局恢复方面表现如何?
- RQ3该模型在真实世界(Cityscapes)和合成(CARLA)城市驾驶场景中,面对不同程度遮挡时是否具备泛化能力?
- RQ4该方法在多大程度上能保留细粒度结构(如路缘石、灯柱、围栏),这些结构常因分割性能差而难以识别?
- RQ5当输入分割图不完美(如来自弱监督模型)时,该方法是否仍能恢复具有物理意义的场景布局?
主要发现
- 所提出的语义修复模型在重建道路布局方面显著优于基于RGB图像的修复基线,尤其在栅栏、灯柱等细粒度类别上表现更优。
- 在MICC-SRI合成数据集上,该方法优于所有基线模型,mIoU较最近邻RGB修复方法高出20个百分点。
- 直接在分割图上进行修复的效果优于先修复RGB图像再分割,原因在于减少了基于纹理重建带来的误差传播。
- 混淆矩阵显示,对大类(如道路、建筑物、人行道)的性能较强,但对小尺寸、细结构物体(如围栏、灯柱)的准确率较低,这本身即为分割模型的固有挑战。
- 即使使用DeepLab-v3+的预测结果而非真实标注的分割图,该方法仍保持高性能,证明其对分割噪声具有鲁棒性。
- 定性结果表明,该模型生成的布局具有一致性与结构合理性,能够保持空间连续性与边界一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。