Skip to main content
QUICK REVIEW

[论文解读] Surface Normal Estimation of Tilted Images via Spatial Rectifier

Tien Do, Khiem Vuong|arXiv (Cornell University)|Jul 17, 2020
Advanced Vision and Imaging参考文献 41被引用 4
一句话总结

本文提出了一种空间校正网络,可学习将倾斜的RGB图像映射到校正空间,使表面法线估计性能与重力对齐的训练数据相当。通过联合训练校正器与法线估计算法,并引入截断角度损失以提升泛化能力,该方法在ScanNet、NYUv2以及一个新的具有大相机翻滚和俯仰角的Tilt-RGBD数据集上实现了最先进性能,同时相比先前模型将FLOPS降低了70%。

ABSTRACT

In this paper, we present a spatial rectifier to estimate surface normals of tilted images. Tilted images are of particular interest as more visual data are captured by arbitrarily oriented sensors such as body-/robot-mounted cameras. Existing approaches exhibit bounded performance on predicting surface normals because they were trained using gravity-aligned images. Our two main hypotheses are: (1) visual scene layout is indicative of the gravity direction; and (2) not all surfaces are equally represented by a learned estimator due to the structured distribution of the training data, thus, there exists a transformation for each tilted image that is more responsive to the learned estimator than others. We design a spatial rectifier that is learned to transform the surface normal distribution of a tilted image to the rectified one that matches the gravity-aligned training data distribution. Along with the spatial rectifier, we propose a novel truncated angular loss that offers a stronger gradient at smaller angular errors and robustness to outliers. The resulting estimator outperforms the state-of-the-art methods including data augmentation baselines not only on ScanNet and NYUv2 but also on a new dataset called Tilt-RGBD that includes considerable roll and pitch camera motion.

研究动机与目标

  • 解决在倾斜图像上测试时,由于训练数据为重力对齐而引起的表面法线估计性能下降问题。
  • 学习一种全局几何变换(空间校正器),使倾斜图像的表面法线分布与竖直训练数据的分布对齐。
  • 通过设计一种截断角度损失,更好地匹配评估指标并提升对小角度误差的鲁棒性,从而改善训练收敛性与模型稳定性。
  • 通过采用空洞卷积与更大感受野的新型网络架构,在保持高精度的同时降低计算成本。

提出的方法

  • 空间校正器由估计的重力方向与倾斜图像的主方向参数化,学习一种类似单应性的变换,以对齐输入图像的表面法线分布与训练数据的分布。
  • 通过合成数据生成端到端训练校正器:利用重力方向与主方向诱导出的一系列单应性,从ScanNet数据集模拟出倾斜图像。
  • 引入截断角度损失(TAL),在小角度误差(低于7.5°)区域提供更强梯度,且对异常值具有鲁棒性,解决了L2损失与角度评估指标之间的不匹配问题。
  • 网络架构在解码层中引入空洞卷积,以在不增加FLOPS的前提下扩大感受野,从而支持如ResNeXt-101等更大模型,同时降低计算成本。
  • 在包含显著翻滚与俯仰运动的ScanNet、NYUv2以及新构建的Tilt-RGBD数据集上进行评估,验证了方法在多种相机姿态下的鲁棒性。
  • 完整流水线联合训练:空间校正器与法线估计算法共同优化,使用合成倾斜图像进行训练,实现域不变特征学习。

实验结果

研究问题

  • RQ1学习到的空间变换能否有效减小倾斜测试图像与重力对齐训练数据之间的域差距,以提升表面法线估计性能?
  • RQ2强调小角度误差的截断角度损失是否能提升模型泛化能力,并在标准评估指标上取得更好表现?
  • RQ3解码路径中使用空洞卷积是否能在不增加FLOPS或内存消耗的前提下扩大感受野并提升模型表达能力?
  • RQ4在具有高相机倾斜的基准数据集(如Tilt-RGBD)上,该方法与最先进方法(包括数据增强基线)相比表现如何?
  • RQ5空间校正器能否在无需显式提供倾斜角度监督的情况下,泛化到包含大翻滚与俯仰角的多样化相机姿态?

主要发现

  • 所提方法在ScanNet与NYUv2上达到最先进性能,平均角度误差分别为15.0°与16.2°,优于FrameNet与VPLNet。
  • 在包含大翻滚与俯仰角的新Tilt-RGBD数据集上,方法在ScanNet上于11.25°与22.5°阈值下分别达到80.0%与85.2%的准确率,在NYUv2上于22.5°阈值下达到77.1%,展现出对倾斜的强鲁棒性。
  • 截断角度损失(TAL)在严格阈值下表现更优(如5°与7.5°),在NYUv2上分别实现50.2%与34.2%的像素落在7.5°与5°误差范围内,优于L2损失与标准角度损失。
  • 采用ResNeXt-101主干的DFPN+TAL+SR模型相比DORN将FLOPS降低70%,在GTX 1660上实现30 FPS推理,同时保持高精度。
  • 空间校正器通过将低频法线区域(如图1中的d, e, f)映射到密集表示区域(d', e', f'),显著降低了这些区域的估计误差,大幅提升了倾斜图像上的预测质量。
  • 该方法在所有指标上均优于数据增强基线与SOTA模型,包括在ScanNet与NYUv2上于30°阈值下分别实现69.3%与83.9%的准确率,且FLOPS与内存消耗更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。