[论文解读] Learning Object-specific Distance from a Monocular Image
本论文提出首个用于自动驾驶中从单目RGB图像进行物体特定距离估计的端到端深度学习模型,采用带有ROI池化的基础模型,并引入结合关键点回归器与投影损失的增强模型以提升精度,尤其在靠近相机的区域。该方法在扩展的KITTI和nuScenes(mini)数据集上优于传统的IPM和SVR基线模型,实现了更低的RMSE和更高的准确性,尤其在弯道和远距离物体上表现更优。
Environment perception, including object detection and distance estimation, is one of the most crucial tasks for autonomous driving. Many attentions have been paid on the object detection task, but distance estimation only arouse few interests in the computer vision community. Observing that the traditional inverse perspective mapping algorithm performs poorly for objects far away from the camera or on the curved road, in this paper, we address the challenging distance estimation problem by developing the first end-to-end learning-based model to directly predict distances for given objects in the images. Besides the introduction of a learning-based base model, we further design an enhanced model with a keypoint regressor, where a projection loss is defined to enforce a better distance estimation, especially for objects close to the camera. To facilitate the research on this task, we construct the extented KITTI and nuScenes (mini) object detection datasets with a distance for each object. Our experiments demonstrate that our proposed methods outperform alternative approaches (e.g., the traditional IPM, SVR) on object-specific distance estimation, particularly for the challenging cases that objects are on a curved road. Moreover, the performance margin implies the effectiveness of our enhanced method.
研究动机与目标
- 为解决自动驾驶中从单目图像进行物体特定距离估计这一研究不足的挑战。
- 克服传统逆透视映射(IPM)的局限性,其在远距离或侧向物体以及弯道场景下失效。
- 开发一种基于深度学习的方法,直接预测物体距离,推理过程中无需依赖相机参数。
- 通过新颖的关键点投影损失,提升靠近相机物体的距离估计精度。
- 通过利用LiDAR与相机标定结果推导出的真实距离,扩展KITTI和nuScenes(mini)数据集,构建新的基准数据集。
提出的方法
- 提出一个基础模型,使用CNN(如VGG16或ResNet50)提取RGB图像特征,通过ROI池化为每个物体生成固定尺寸的特征,并使用全连接层回归预测距离。
- 引入一个增强模型,包含关键点回归器,用于预测3D物体关键点在2D图像中的坐标(X, Y),并结合预测的Z距离形成3D点。
- 定义投影损失,强制预测的3D关键点通过相机投影矩阵准确投影回真实2D关键点位置,提升空间一致性。
- 使用距离回归损失与投影损失的联合损失进行端到端训练,同时引入分类器分支以学习类别判别性特征。
- 仅在训练阶段使用相机参数计算投影损失;推理阶段完全不依赖相机参数,实现跨视觉系统的泛化能力。
- 通过LiDAR点云和相机参数计算物体距离,将真实距离添加至KITTI和nuScenes(mini)的目标检测标注中,构建扩展数据集。
实验结果
研究问题
- RQ1深度学习模型能否在推理阶段不依赖相机参数的情况下,直接从单张RGB图像预测物体特定距离?
- RQ2引入关键点回归器与投影损失后,是否能显著提升距离估计精度,特别是在靠近相机的物体上?
- RQ3所提出的模型能否泛化到传统IPM失效的复杂场景,如弯道和远距离目标检测?
- RQ4在距离估计精度与推理速度方面,该模型与经典基线方法(如IPM和SVR)相比表现如何?
- RQ5增加类别分类器在多大程度上提升了模型估计物体距离的能力?
主要发现
- 在KITTI数据集上,增强模型的δ1得分为0.629,显著优于基础模型(0.587)和SVR(0.308),证明了关键点投影损失的有效性。
- 在nuScenes(mini)数据集上,增强模型的δ1为0.535,RMSE为10.511,优于IPM(δ1: 0.441,RMSE: 249.849)和SVR(δ1: 0.308,RMSE: 18.480)。
- 增强模型将KITTI上的RMSE log从基础模型的0.512降低至0.314,表明其在远距离距离估计方面性能显著提升。
- 推理速度为每张图像16.2ms(使用VGG16),比IPM(33.9ms)快一倍,也快于SVR(12.1ms),展现出良好的实时可行性。
- 引入分类器后,AR(平均相对误差)从基础模型无分类器时的0.658降至0.311(基础模型带分类器),证明其在学习类别感知特征方面的价值。
- 定性结果表明,该模型成功估计了超过40米外的物体距离,并在弯道场景中表现良好,而IPM在此类场景中失效,同时对近距离物体保持了高精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。