[论文解读] Pseudo-Stereo for Monocular 3D Object Detection in Autonomous Driving
本文提出了一种伪立体3D检测框架,通过图像级、特征级和特征克隆级的虚拟视图生成方法,从单目图像生成虚拟立体视图。通过结合深度估计与逐差异动态卷积以自适应地过滤特征,该方法在KITTI-3D基准测试中实现了最先进性能,在汽车、行人和骑行人三类目标的单目3D检测任务中均排名第一。
Pseudo-LiDAR 3D detectors have made remarkable progress in monocular 3D detection by enhancing the capability of perceiving depth with depth estimation networks, and using LiDAR-based 3D detection architectures. The advanced stereo 3D detectors can also accurately localize 3D objects. The gap in image-to-image generation for stereo views is much smaller than that in image-to-LiDAR generation. Motivated by this, we propose a Pseudo-Stereo 3D detection framework with three novel virtual view generation methods, including image-level generation, feature-level generation, and feature-clone, for detecting 3D objects from a single image. Our analysis of depth-aware learning shows that the depth loss is effective in only feature-level virtual view generation and the estimated depth map is effective in both image-level and feature-level in our framework. We propose a disparity-wise dynamic convolution with dynamic kernels sampled from the disparity feature map to filter the features adaptively from a single image for generating virtual image features, which eases the feature degradation caused by the depth estimation errors. Till submission (November 18, 2021), our Pseudo-Stereo 3D detection framework ranks 1st on car, pedestrian, and cyclist among the monocular 3D detectors with publications on the KITTI-3D benchmark. The code is released at https://github.com/revisitq/Pseudo-Stereo-3D.
研究动机与目标
- 通过从单张图像生成伪立体视图,以缩小单目与立体3D检测器之间的性能差距。
- 通过利用图像到图像立体生成的生成差距小于图像到LiDAR生成的差距,从而提升单目3D检测性能。
- 通过自适应特征过滤缓解深度估计误差在虚拟视图生成中导致的特征退化问题。
- 分析深度监督与估计深度图在不同虚拟视图生成阶段的有效性。
提出的方法
- 提出三种虚拟视图生成方法:图像级(使用估计的视差图对输入图像进行扭曲)、特征级(对左视图特征应用逐差异动态卷积)、特征克隆级(将左视图特征克隆为虚拟右视图特征)。
- 引入一种逐差异动态卷积(DDC),从视差特征图中采样动态卷积核,以自适应地过滤特征,从而减少因深度估计误差导致的特征退化。
- 使用预训练的深度估计网络生成视差图,用以指导图像级和特征级的虚拟视图生成。
- 采用立体3D检测器(如LIGA-Stereo)作为主干网络,处理生成的伪立体视图以实现3D目标检测。
- 在特征级生成中应用深度损失作为监督信号,以增强深度感知特征学习。
- 支持深度引导与无深度依赖的训练模式,其中特征克隆方法作为无需依赖深度的稳健基线。
实验结果
研究问题
- RQ1与伪LiDAR方法相比,从单张图像生成虚拟立体视图是否能显著提升单目3D检测性能?
- RQ2在不同虚拟视图生成层级中,估计的深度图与深度损失在引导深度感知特征学习方面的有效性如何?
- RQ3所提出的逐差异动态卷积是否能有效减少特征级生成中因深度估计误差导致的特征退化?
- RQ4不同虚拟视图生成策略在分布偏移到测试集时的泛化能力如何?
- RQ5该伪立体框架在标准基准(如KITTI-3D)上与最先进单目3D检测器相比表现如何?
主要发现
- 所提出的特征级虚拟视图生成方法结合逐差异动态卷积(Ours-fld)在KITTI-3D基准测试中,于汽车、行人和骑行人三类目标上均取得第一名。
- Ours-fld在仅使用单一模型的情况下,优于最先进方法(如DD3D、GUPNet和MonoPSR),在AP3D与APBEV指标上均表现更优。
- 深度损失仅在特征级生成中至关重要,而估计的深度图在图像级和特征级设置中均能提升性能。
- 特征克隆方法表现出更好的泛化能力,其在验证集与测试集之间的性能差距更小,原因在于其不依赖于深度估计。
- 该框架在所有目标类别与指标上,取得了18项最佳结果和15项第二名结果,展现出强大的鲁棒性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。