Skip to main content
QUICK REVIEW

[论文解读] Direct-PoseNet: Absolute Pose Regression with Photometric Consistency

Shuai Chen, Zirui Wang|arXiv (Cornell University)|Apr 8, 2021
Advanced Vision and Imaging参考文献 57被引用 6
一句话总结

Direct-PoseNet 提出了一种新颖的单图像绝对位姿回归方法,通过集成基于可微渲染的可微匹配模块实现光度监督,从而提升精度,支持端到端训练,同时使用位姿损失和图像重建损失。该方法在 7-Scenes 和 LLFF 基准上达到最先进性能,优于以往的 APR 方法,同时保持低推理延迟。

ABSTRACT

We present a relocalization pipeline, which combines an absolute pose regression (APR) network with a novel view synthesis based direct matching module, offering superior accuracy while maintaining low inference time. Our contribution is twofold: i) we design a direct matching module that supplies a photometric supervision signal to refine the pose regression network via differentiable rendering; ii) we modify the rotation representation from the classical quaternion to SO(3) in pose regression, removing the need for balancing rotation and translation loss terms. As a result, our network Direct-PoseNet achieves state-of-the-art performance among all other single-image APR methods on the 7-Scenes benchmark and the LLFF dataset.

研究动机与目标

  • 为解决单图像绝对位姿回归(APR)与基于 3D 结构的方法之间的精度差距,后者通常需要深度图或 SfM 数据。
  • 在不依赖视觉里程计或位姿图优化等外部监督的情况下,提升 APR 性能。
  • 在训练过程中引入光度一致性作为监督信号,以增强位姿回归的鲁棒性。
  • 通过自监督光度损失有效利用未标注数据,提升泛化能力,而无需额外标注。

提出的方法

  • 一个位姿回归网络使用预训练的 CNN 主干网络,从单张 RGB 图像中预测 6-DoF 相机位姿。
  • 一个可微神经渲染模块利用预测的位姿,合成 3D 场景的新视角,生成用于光度监督的合成图像。
  • 该方法采用多损失训练目标,结合真实位姿损失与输入查询图像和渲染图像之间的光度重建损失。
  • 通过可微渲染管道强制实现光度一致性,使图像相似度梯度反向传播以优化位姿预测。
  • 直接匹配模块通过最小化查询图像与渲染视图之间的光度误差,实现使用未标注图像的自监督。
  • 训练过程为端到端,梯度从光度损失经由渲染网络反向传播至位姿回归器。

实验结果

研究问题

  • RQ1通过可微渲染实现的光度一致性能否提升单图像绝对位姿回归的精度?
  • RQ2在不依赖相对位姿或几何约束的情况下,能否有效利用未标注图像进行 APR?
  • RQ3与仅使用标准位姿回归损失相比,集成直接图像匹配监督是否能带来更好的泛化性和鲁棒性?
  • RQ4直接匹配模块能否在保持低推理时间的同时实现 APR 的最先进性能?

主要发现

  • 在 7-Scenes 基准上,Direct-PoseNet 实现了最先进性能,使用未标注数据后,平均中值平移误差降低至 0.16m,旋转误差降低至 5.17°。
  • 在 LLFF 数据集上,该方法优于现有单图像 APR 方法,展现出在多样化场景中的强大泛化能力。
  • 光度损失的引入显著提升了在纹理贫乏和背景平坦场景(如 NeRF Synthetic 中的 Lego 场景)下的性能,而仅使用位姿损失时无法有效正则化预测。
  • 即使采用默认损失权重(λ₁=0.3,λ₂=0.7),光度损失在训练中仍占主导地位,证明其在引导位姿优化方面的有效性。
  • 该方法保持了低推理时间,每张图像处理时间低于 6ms,适用于实时部署。
  • 消融实验确认,位姿损失与光度损失均不可或缺:任一损失的移除均导致性能下降,尤其在挑战性场景中更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。