Skip to main content
QUICK REVIEW

[论文解读] UprightNet: Geometry-Aware Camera Orientation Estimation from Single Images

Wenqi Xian, Zhengqi Li|arXiv (Cornell University)|Aug 19, 2019
Advanced Vision and Imaging参考文献 47被引用 9
一句话总结

UprightNet 提出了一种几何感知的深度学习框架,通过在局部相机坐标系和全局直立坐标系中预测表面几何,进而通过可微分最小二乘法求解最优旋转,实现从单张 RGB 图像中估计 2D 相机姿态(俯仰角和滚转角)。该方法通过显式建模局部与全局表面帧之间的几何一致性,在合成数据集和真实世界室内数据集上均实现了最先进水平的精度与泛化能力。

ABSTRACT

We introduce UprightNet, a learning-based approach for estimating 2DoF camera orientation from a single RGB image of an indoor scene. Unlike recent methods that leverage deep learning to perform black-box regression from image to orientation parameters, we propose an end-to-end framework that incorporates explicit geometric reasoning. In particular, we design a network that predicts two representations of scene geometry, in both the local camera and global reference coordinate systems, and solves for the camera orientation as the rotation that best aligns these two predictions via a differentiable least squares module. This network can be trained end-to-end, and can be supervised with both ground truth camera poses and intermediate representations of surface geometry. We evaluate UprightNet on the single-image camera orientation task on synthetic and real datasets, and show significant improvements over prior state-of-the-art approaches.

研究动机与目标

  • 通过引入显式几何推理而非依赖黑箱回归,提升从单张 RGB 图像中估计 2D 相机姿态的性能。
  • 解决先前基于学习的方法缺乏几何归纳偏差的问题,从而改善泛化能力并增强可解释性。
  • 开发一种联合预测局部(相机)与全局(直立)坐标系中表面几何的框架,以支持姿态估计的几何对齐。
  • 通过在中间几何表示和最终姿态输出上同时进行监督,实现端到端训练,提升鲁棒性与性能。

提出的方法

  • 网络同时预测局部相机坐标系与全局直立坐标系中的三种几何表示:表面法向量、切向量与副法向量。
  • 将相机姿态估计建模为一个可微分的最小二乘问题,通过寻找使预测的局部表面帧与全局表面帧对齐的旋转。
  • 利用预测的权重图抑制不可靠的几何预测,提升对噪声或模糊区域的鲁棒性。
  • 网络采用多任务监督进行训练:同时在最终姿态误差和中间几何表示(如表面法向量与切平面)上进行监督。
  • 该框架具备端到端可微性,支持通过几何对齐模块进行反向传播。
  • 利用表面帧作为中间表示,编码诸如墙面垂直性与地面水平性等几何先验信息。

实验结果

研究问题

  • RQ1显式几何推理是否能提升深度学习模型在单图像相机姿态估计任务中的精度与泛化能力?
  • RQ2与仅从原始像素学习相比,同时引入局部与全局几何表示在姿态估计中带来了何种提升?
  • RQ3使用可微分几何对齐模块相比直接回归基线方法,性能提升程度如何?
  • RQ4在中间几何表示(如表面法向量与切平面)上施加监督,是否能提升模型在未见室内场景中的泛化能力?
  • RQ5使用结构化几何特征(如法向量与切平面)是否能提升在结构稀疏场景下的鲁棒性?

主要发现

  • 在 InteriorNet 测试集上,UprightNet 实现了 1.17°(平均)与 0.52°(中位数)的角误差,显著优于先前最先进方法。
  • 在 SUN360 数据集上,UprightNet 展现出良好泛化能力,平均角误差为 7.81°,优于卷积神经网络回归方法(10.43°)与 DeepHorizon(9.53°)。
  • 消融实验表明,若移除局部或全局几何监督,误差均会上升,证实了双帧几何预测的重要性。
  • 完整模型在同时使用 F^c 与 F^u 监督及权重图的情况下,相比无几何监督的消融实验,角误差降低了 40%。
  • 该方法在未见的 SUN360 数据上表现出强泛化能力,平均角误差相比次优方法相对降低 25%。
  • 失败案例多出现在缺乏结构线索的场景中(如平坦墙面或均匀地板),表明需要引入额外几何先验(如消失点或已知内参)以进一步提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。