Skip to main content
QUICK REVIEW

[論文レビュー] DSAC - Differentiable RANSAC for Camera Localization

Eric Brachmann, Alexander Krull|arXiv (Cornell University)|Nov 17, 2016
Robotics and Sensor-Based Localization参考文献 38被引用数 12
ひとこと要約

本論文では、カメラ局所化のための深層学習パイプラインのエンドツーエンド学習を可能にする、RANSACの微分可能版であるDSACを紹介する。RANSACのハードな仮説選択を確率的で微分可能な選択プロセスに置き換えることで、頑健推定ステップを逆誤差伝搬可能にし、7-Scenesデータセットにおいて最先端手法よりも7.3%の精度向上を達成した。

ABSTRACT

RANSAC is an important algorithm in robust optimization and a central building block for many computer vision applications. In recent years, traditionally hand-crafted pipelines have been replaced by deep learning pipelines, which can be trained in an end-to-end fashion. However, RANSAC has so far not been used as part of such deep learning pipelines, because its hypothesis selection procedure is non-differentiable. In this work, we present two different ways to overcome this limitation. The most promising approach is inspired by reinforcement learning, namely to replace the deterministic hypothesis selection by a probabilistic selection for which we can derive the expected loss w.r.t. to all learnable parameters. We call this approach DSAC, the differentiable counterpart of RANSAC. We apply DSAC to the problem of camera localization, where deep learning has so far failed to improve on traditional approaches. We demonstrate that by directly minimizing the expected loss of the output camera poses, robustly estimated by RANSAC, we achieve an increase in accuracy. In the future, any deep learning pipeline can use DSAC as a robust optimization component.

研究の動機と目的

  • RANSACを頑健推定コンponentとして含む深層学習パイプラインのエンドツーエンド学習を可能にすること。これは従来、非微分可能であった。
  • 勾配ベース最適化のためのRANSACの仮説選択(argmax)の非微分可能性を克服すること。
  • RANSACのハード選択動作を保持しながら勾配伝播を可能にする微分可能なRANSACの変種を開発すること。
  • RANSACで推定されたポーズの期待損失を直接最小化することで、カメラ局所化の精度を向上させること。
  • 確率的仮説選択が過学習を回避し、頑健性を維持する点でソフトargmaxに優れていることを示すこと。

提案手法

  • ソフトargmax(仮説の重み付き平均)と確率的選択(微分可能なサンプリングを伴うハード選択)の2種類の微分可能なRANSACの変種を提案する。
  • 仮説選択を可学習確率分布を持つ確率的プロセスとして扱う、DSACと呼ばれる微分可能なRANSACを導入する。
  • 期待損失の勾配をネットワーク重みに関して計算するため、ポリシー勾配スタイルの逆誤差伝搬を用いる。これによりエンドツーエンド学習が可能になる。
  • 2ストリームCNNアーキテクチャを採用する:1つはシーン座標を予測し、もう1つは仮説をスコアリングする。両者はDSACで接続される。
  • 再パrameter化トリックと対数微分トリックを用いて勾配を導出する。期待損失と確率勾配の主要な式(式13–14)を提示する。
  • シーン座標回帰フォレストを用いたカメラ局所化に本手法を適用し、従来のRANSACの代わりにDSACをポーズ推定に使用する。

実験結果

リサーチクエスチョン

  • RQ1RANSACを微分可能にすることで、深層学習パイプラインのエンドツーエンド学習を可能にできるか?
  • RQ2DSACにおける確率的仮説選択は、従来のRANSACの頑健性を保持しながら勾配ベース最適化を可能にするか?
  • RQ3DSACはソフトargmaxに基づく微分可能なRANSACと比較して、一般化性能と頑健性に優れているか?
  • RQ4DSACはポーズ推定の期待損失を直接最小化することで、カメラ局所化の精度を向上させられるか?
  • RQ5DSACはテクスチャレスな表面、モーションブラー、繰り返し構造といった現実世界の困難な状況でも性能を維持できるか?

主な発見

  • DSACは7-Scenesデータセットにおいて、最先端手法を7.3%上回る精度を達成し、カメラ局所化分野で過去の手法を上回った。
  • DSACの確率的選択バージョンはソフトargmaxアプローチを上回り、過学習が低減され、一般化性能が優れていることが示された。
  • インライヤ比が5%という低水準でも高い精度を維持しており、ノイズやスパースな予測に対しても頑健であることが実証された。
  • 本手法はテクスチャレスな表面、モーションブラー、反射、繰り返し構造といった困難なシーンを効果的に処理でき、すべてのケースで正しくカメラポーズを推定した。
  • 逆ポーズを用いたカメラポーズ評価誤差を是正したところ、再計算された精度は45.5%となった。この値は、標準的な反復的PnPアルゴリズムに切り替えることで顕著に向上した。
  • 元の実装ではなく反復的PnPアルゴリズムを採用したことが、最終的な報告性能向上の主な要因であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。