Skip to main content
QUICK REVIEW

[论文解读] End-to-End Learnable Geometric Vision by Backpropagating PnP Optimization

Bo Chen, Álvaro Parra|arXiv (Cornell University)|Sep 13, 2019
Advanced Vision and Imaging参考文献 56被引用 5
一句话总结

本文提出BPnP,一种可微分的PnP求解器,通过隐式微分实现对PnP优化的端到端反向传播。通过精确计算PnP求解器中的梯度,BPnP实现了神经网络特征、相机位姿和3D结构的联合学习,在结合热力图和重投影监督的损失下,实现了物体位姿估计的最先进性能。

ABSTRACT

Deep networks excel in learning patterns from large amounts of data. On the other hand, many geometric vision tasks are specified as optimization problems. To seamlessly combine deep learning and geometric vision, it is vital to perform learning and geometric optimization end-to-end. Towards this aim, we present BPnP, a novel network module that backpropagates gradients through a Perspective-n-Points (PnP) solver to guide parameter updates of a neural network. Based on implicit differentiation, we show that the gradients of a "self-contained" PnP solver can be derived accurately and efficiently, as if the optimizer block were a differentiable function. We validate BPnP by incorporating it in a deep model that can learn camera intrinsics, camera extrinsics (poses) and 3D structure from training datasets. Further, we develop an end-to-end trainable pipeline for object pose estimation, which achieves greater accuracy by combining feature-based heatmap losses with 2D-3D reprojection errors. Since our approach can be extended to other optimization problems, our work helps to pave the way to perform learnable geometric vision in a principled manner. Our PyTorch implementation of BPnP is available on http://github.com/BoChenYS/BPnP.

研究动机与目标

  • 实现对深度网络的端到端训练,联合优化几何视觉任务,如位姿估计、3D重建和相机标定。
  • 解决通过非可微分几何优化求解器(如PnP)反向传播梯度的挑战。
  • 在统一的可微分流水线中结合深度特征学习与成熟的几何优化方法。
  • 通过整合2D-3D重投影误差与热力图监督,提升物体位姿估计的性能。
  • 为深度学习中的可微分几何优化提供可泛化的框架。

提出的方法

  • BPnP使用隐式微分,通过解析方法计算通过自包含PnP求解器的梯度,避免使用中心差分等近似数值方法。
  • 该方法通过求解优化问题KKT条件的隐式方程,推导出PnP解对输入特征的梯度。
  • 将可微分PnP层集成到深度神经网络中,实现对特征提取器和几何优化模块的端到端反向传播。
  • 该框架支持通过端到端反向传播联合优化3D结构、相机位姿和内参参数。
  • 采用结合热力图回归与2D-3D重投影误差的混合损失,以改善特征表示学习。
  • 实现代码以PyTorch发布,可无缝集成到现有深度学习流水线中。

实验结果

研究问题

  • RQ1能否通过隐式微分在PnP求解器中准确且高效地反向传播梯度,以实现几何视觉任务的端到端深度网络训练?
  • RQ2将热力图监督与2D-3D重投影误差结合,对物体位姿估计模型的性能有何影响?
  • RQ3可微分PnP层是否能提升端到端学习框架中3D结构、相机位姿和内参参数估计的准确性?
  • RQ4在泛化性和鲁棒性方面,BPnP与当前最先进端到端位姿估计方法相比表现如何?
  • RQ5隐式微分在视觉中其他几何优化问题上的适用范围有多大?

主要发现

  • BPnP模块通过隐式微分实现对PnP求解器的精确且高效梯度计算,避免了数值近似方法的计算开销。
  • 在LINEMOD数据集上,采用混合损失($\ell_m$)训练的模型平均ADD(-S)准确率达到93.27%,优于仅使用热力图($\ell_h$: 93.27% vs. 92.27%)或仅使用重投影($\ell_p$: 85.12%)损失的模型。
  • 在更严格的2像素阈值下,混合损失实现了90.79%的平均2D投影准确率,显著优于纯热力图损失(90.12%)和仅重投影损失(86.56%)。
  • 基于BPnP的流水线在物体位姿估计任务中达到了最先进性能,尽管训练图像更少且未使用数据增强,仍超越了当前SOTA方法PVNet。
  • 几何约束(重投影误差)的引入显著改善了特征学习,表现为混合损失相比仅热力图监督的性能更优。
  • 该方法具备良好的泛化能力,可扩展至其他几何优化问题,如运动结构重建和相机标定,实现端到端可微分的几何流水线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。