Skip to main content
QUICK REVIEW

[论文解读] DirectShape: Direct Photometric Alignment of Shape Priors for Visual Vehicle Pose and Shape Estimation

Rui Wang, Nan Yang|arXiv (Cornell University)|Apr 22, 2019
Robotics and Sensor-Based Localization参考文献 41被引用 9
一句话总结

本文提出DirectShape,一种新颖的方法,通过在图像空间中直接利用光度对齐与形状先验,实现从立体图像中联合估计3D车辆位姿与形状。通过在不依赖立体点云的情况下,在图像空间中优化能量函数,该方法在位姿与形状估计方面实现了更高的精度,并通过精炼显著提升了最先进深度学习检测器的性能。

ABSTRACT

Scene understanding from images is a challenging problem encountered in autonomous driving. On the object level, while 2D methods have gradually evolved from computing simple bounding boxes to delivering finer grained results like instance segmentations, the 3D family is still dominated by estimating 3D bounding boxes. In this paper, we propose a novel approach to jointly infer the 3D rigid-body poses and shapes of vehicles from a stereo image pair using shape priors. Unlike previous works that geometrically align shapes to point clouds from dense stereo reconstruction, our approach works directly on images by combining a photometric and a silhouette alignment term in the energy function. An adaptive sparse point selection scheme is proposed to efficiently measure the consistency with both terms. In experiments, we show superior performance of our method on 3D pose and shape estimation over the previous geometric approach and demonstrate that our method can also be applied as a refinement step and significantly boost the performances of several state-of-the-art deep learning based 3D object detectors. All related materials and demonstration videos are available at the project page https://vision.in.tum.de/research/vslam/direct-shape.

研究动机与目标

  • 解决当前3D目标检测器仅估计粗略3D边界框的局限性,这些边界框缺乏详细的形状与位姿信息。
  • 通过直接在图像空间中工作,避免传统几何对齐流程中由立体匹配引入的误差。
  • 通过符号距离函数(SDF)隐式引入3D形状先验,提升对遮挡、光照变化和反光表面的鲁棒性。
  • 开发一种可微分的端到端优化框架,通过光度一致性和轮廓一致性,联合优化图像中的3D位姿与形状。
  • 通过将该方法作为后处理精炼步骤,提升现有基于深度学习的3D检测器性能。

提出的方法

  • 使用从形状先验中导出的3D符号距离函数(SDF)的低维线性子空间表示车辆形状。
  • 构建一个非线性最小二乘能量函数,结合光度残差(左右图像之间的颜色一致性)与轮廓残差(掩码对齐)。
  • 使用高斯-牛顿优化方法,直接在图像强度上优化3D刚体位姿与形状参数。
  • 实现一种自适应稀疏点选择方案,以高效计算光度一致性和轮廓一致性项。
  • 避免中间立体重建步骤,直接将形状先验对齐至图像特征,减少误差传播。
  • 将该方法作为现有3D检测器的精炼模块集成,无需重新训练即可提升输出质量。

实验结果

研究问题

  • RQ1在图像空间中直接进行光度与轮廓对齐,是否能优于使用立体点云的几何对齐方法,在3D车辆位姿与形状估计中表现更优?
  • RQ2在遮挡与光照不良等挑战性条件下,可微分的图像空间优化框架在多大程度上能提升3D形状与位姿估计的准确性?
  • RQ3在真实场景中,该方法作为基于深度学习的3D目标检测器的精炼步骤,其有效性如何?
  • RQ4基于SDF的形状先验是否能增强对立体匹配生成的不完整或噪声3D重建的鲁棒性?
  • RQ5该方法能否在长距离车辆、截断和部分遮挡等多样化真实场景条件下实现良好泛化?

主要发现

  • 在KITTI Stereo 2015基准上,所提方法在所有形状评估指标(完整性、准确率、F1分数、RMSE)上均优于先前的几何对齐方法。
  • 在形状估计方面,与几何基线相比,在τ = 0.1m时,F1分数提高3.4%,RMSE降低1.2 mm。
  • 在3D位姿估计方面,该方法在KITTI 3D目标检测基准的所有难度级别(Easy、Moderate、Hard)下均实现了更高的平均精度(AP)。
  • 作为精炼步骤应用时,该方法显著提升了四种最先进3D检测器(Mono3D、Deep3DBox、3DOP、MLF)的性能,提高了其AP_{3D}与AP_{bv}得分。
  • 定性结果表明,即使在严重遮挡和远距离车辆等挑战性场景下,该方法仍能生成更准确且一致的3D形状与位姿。
  • 该方法在推理阶段无需LiDAR或立体点云,仅依赖立体图像与分割掩码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。