Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Learnable Geometric Vision by Backpropagating PnP Optimization

Bo Chen, Álvaro Parra|arXiv (Cornell University)|Sep 13, 2019
Advanced Vision and Imaging参考文献 56被引用数 5
ひとこと要約

この論文では、暗黙の微分を用いてPnP最適化を微分可能にし、エンド・トゥ・エンドのバックプロパゲーションを可能にする、微分可能なPnPソルバーブ・ピーエヌピー(BPnP)を提案する。PnPソルバを介した勾配の正確な計算により、BPnPはニューラルネットワーク特徴量、カメラポーズ、3次元構造の共同学習を可能にし、ヒートマップと再投影の監視を組み合わせた損失を用いて、オブジェクトポーズ推定で最先端の性能を達成する。

ABSTRACT

Deep networks excel in learning patterns from large amounts of data. On the other hand, many geometric vision tasks are specified as optimization problems. To seamlessly combine deep learning and geometric vision, it is vital to perform learning and geometric optimization end-to-end. Towards this aim, we present BPnP, a novel network module that backpropagates gradients through a Perspective-n-Points (PnP) solver to guide parameter updates of a neural network. Based on implicit differentiation, we show that the gradients of a "self-contained" PnP solver can be derived accurately and efficiently, as if the optimizer block were a differentiable function. We validate BPnP by incorporating it in a deep model that can learn camera intrinsics, camera extrinsics (poses) and 3D structure from training datasets. Further, we develop an end-to-end trainable pipeline for object pose estimation, which achieves greater accuracy by combining feature-based heatmap losses with 2D-3D reprojection errors. Since our approach can be extended to other optimization problems, our work helps to pave the way to perform learnable geometric vision in a principled manner. Our PyTorch implementation of BPnP is available on http://github.com/BoChenYS/BPnP.

研究の動機と目的

  • オブジェクトポーズ推定、3次元再構築、カメラキャリブレーションなどの幾何的ビジョンタスクを共同で最適化する深層ネットワークのエンド・トゥ・エンド学習を可能にすること。
  • PnPのような非微分可能な幾何的最適化ソルバを経由した勾配のバックプロパゲーションの課題に対処すること。
  • 深層特徴学習と確立された幾何的最適化手法を統合的かつ微分可能なパイプラインとして統合すること。
  • 2次元-3次元再投影誤差とヒートマップ監視を統合することで、オブジェクトポーズ推定の性能を向上させること。
  • 深層学習における微分可能な幾何的最適化の汎用的フレームワークを提供すること。

提案手法

  • BPnPは、中央差分のような近似数値法を避けるために、自己完結的なPnPソルバを介して勾配を解析的に計算する暗黙の微分を用いる。
  • 最適化のKKT条件の暗黙方程式を解くことで、入力特徴量に関するPnP解の勾配を導出する。
  • 微分可能なPnPレイヤーを深層ニューラルネットワークに統合し、特徴抽出部と幾何的最適化ブロックの両方をバックプロパゲーション可能にする。
  • エンド・トゥ・エンドのバックプロパゲーションにより、3次元構造、カメラポーズ、内部パラメータの共同最適化を可能にする。
  • 特徴表現学習の向上を図るために、ヒートマップ回帰と2次元-3次元再投影誤差を組み合わせた混合損失を使用する。
  • 実装はPyTorchで公開されており、既存の深層学習パイプラインへの統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1PnPソルバを介した勾配を正確かつ効率的にバックプロパゲーション可能にでき、幾何的ビジョンタスクのためのエンド・トゥ・エンド学習を可能にするか?
  • RQ2ヒートマップ監視と2次元-3次元再投影誤差を組み合わせることで、オブジェクトポーズ推定モデルの性能にどのような影響を与えるか?
  • RQ3微分可能なPnPレイヤーは、エンド・トゥ・エンド学習フレームワークにおいて3次元構造、カメラポーズ、内部パラメータ推定の精度を向上させられるか?
  • RQ4一般化性とロバスト性の観点から、BPnPは最先端のエンド・トゥ・エンドポーズ推定手法と比較してどの程度優れているか?
  • RQ5暗黙の微分は、ビジョン分野の他の幾何的最適化問題へどの程度適用可能か?

主な発見

  • BPnPモジュールは、数値近似の計算コストを回避する暗黙の微分を用いて、PnPソルバを介した正確かつ効率的な勾配計算を可能にする。
  • LINEMODデータセットでは、混合損失($\ell_m$)で学習したモデルが平均ADD(-S)精度93.27%を達成し、ヒートマップのみ($\ell_h$:93.27% 対 92.27%)や再投影のみ($\ell_p$:85.12%)の損失で学習したモデルを上回った。
  • 2ピクセルの stricter な閾値を用いた場合、混合損失は平均90.79%の2次元投影精度を達成し、純粋なヒートマップ損失(90.12%)や再投影のみ損失(86.56%)を顕著に上回った。
  • BPnPベースのパイプラインは、オブジェクトポーズ推定で最先端の性能を達成し、より少ない学習画像とデータオーグメンテーションを用いても、現在のSOTA手法PVNetを上回った。
  • 幾何的制約(再投影誤差)の統合が特徴学習を顕著に向上させたことが、混合損失がヒートマップのみの監視よりも優れた性能を示すことで裏付けられた。
  • 本手法は汎用的であり、ストラクチャ・フォーム・モーション やカメラキャリブレーションなどの他の幾何的最適化問題へも拡張可能であり、エンド・トゥ・エンドで微分可能な幾何的パイプラインの実現を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。