Skip to main content
QUICK REVIEW

[論文レビュー] Deep Bingham Networks: Dealing with Uncertainty and Ambiguity in Pose Estimation

Haowen Deng, Mai Bui|arXiv (Cornell University)|Dec 20, 2020
Human Pose and Action Recognition被引用数 6
ひとこと要約

本稿では、6次元姿勢推定をクaternion上でのビンギング混合モデルを用いた多モード分布としてモデル化することで、一意でないおよび一意なシーンの両方における不確実性を考慮した予測を可能にする、深層学習フレームワーク「Deep Bingham Networks (DBN)」を提案する。本手法は、モード崩壊を防止し数値安定性を向上させるための新しいトレーニング戦略を組み込むことで、6次元カメラ再ロケリゼーションおよび3次元オブジェクト姿勢推定において最先端の性能を達成する。

ABSTRACT

In this work, we introduce Deep Bingham Networks (DBN), a generic framework that can naturally handle pose-related uncertainties and ambiguities arising in almost all real life applications concerning 3D data. While existing works strive to find a single solution to the pose estimation problem, we make peace with the ambiguities causing high uncertainty around which solutions to identify as the best. Instead, we report a family of poses which capture the nature of the solution space. DBN extends the state of the art direct pose regression networks by (i) a multi-hypotheses prediction head which can yield different distribution modes; and (ii) novel loss functions that benefit from Bingham distributions on rotations. This way, DBN can work both in unambiguous cases providing uncertainty information, and in ambiguous scenes where an uncertainty per mode is desired. On a technical front, our network regresses continuous Bingham mixture models and is applicable to both 2D data such as images and to 3D data such as point clouds. We proposed new training strategies so as to avoid mode or posterior collapse during training and to improve numerical stability. Our methods are thoroughly tested on two different applications exploiting two different modalities: (i) 6D camera relocalization from images; and (ii) object pose estimation from 3D point clouds, demonstrating decent advantages over the state of the art. For the former we contributed our own dataset composed of five indoor scenes where it is unavoidable to capture images corresponding to views that are hard to uniquely identify. For the latter we achieve the top results especially for symmetric objects of ModelNet dataset.

研究の動機と目的

  • 対称的または繰り返し構造を持つ現実世界のシーンにおける一意解の姿勢推定の限界を解決する。
  • 一意でない状況において、単一の予測だけでなく複数の妥当な仮説の両方の不確実性をモデル化する。
  • 回転に対して連続的なビンギング混合モデルを回帰し、並進に対してはガウス混合モデルを回帰する深層学習フレームワークを開発する。
  • WTA(勝者1体)に基づく新しいトレーニング戦略を用いて、多モード姿勢予測におけるモード崩壊を防止し、トレーニングの安定性を向上させる。
  • 2次元画像ベースのカメラ再ロケリゼーションおよび3次元点群ベースのオブジェクト姿勢推定の両タスクで優れた性能を示す。

提案手法

  • クォータニオン上での単一ビンギング分布を回帰するユニモーダル・ビンギングネットワーク(UBN)を提案し、回転の不確実性をモデル化する。
  • UBNを拡張し、複数の非等方的ビンギング分布の混合を回帰するマルチモーダル・ビンギングネットワーク(MBN)を構築し、複数の妥当な姿勢を捉える。
  • 並進成分の不確実性を関連付けるために、ガウス混合モデル(GMM)を用いて並進をモデル化する。
  • ビンギング混合モデルにおけるモード崩壊を防止し、トレーニングを安定化させるために、新しいWTA(勝者1体)損失戦略を導入する。
  • 回転の最適化をリーマン多様体上の回転群SO(3)で行うために、地図的損失とL1損失をそれぞれ回転および並進予測に用いる。
  • Zhouらが提唱した6次元回転の連続的表現を活用し、SO(3)への写像における不連続性を回避する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、3次元姿勢推定における曇りを捉えるために、多モード姿勢分布を効果的にモデル化できるか?
  • RQ2単一および複数の姿勢仮説の両方に対して、不確実性を意味的に定量化し回帰できるか?
  • RQ3ビンギング分布を用いた回転推定における混合モデルのモード崩壊を防ぐために、新しいトレーニング目的関数が有効か?
  • RQ4提案されたフレームワークは、一意でないおよび一意な姿勢推定の両状況において、最先端の手法を上回る性能を示せるか?
  • RQ5本フレームワークは、2次元画像や3次元点群といった異なるモダリティに一般化可能か?

主な発見

  • 提案されたMBNモデルは、著者らが作成した一意でない屋内データセットにおいて、20°/0.3mの閾値で0.56の成功率を達成し、6次元カメラ再ロケリゼーションタスクで最先端の性能を示した。
  • 3次元オブジェクト姿勢推定のModelNet10データセットでは、MBNは平均並進誤差1.079を達成し、MDN(1.140)およびMC-Dropout(2.192)を上回った。
  • MBNにWTA損失を組み込むことで、標準的なMDNベースのトレーニングに比べて平均で10%の誤差低減が達成された。
  • 本フレームワークは、一様モードおよび多様モードの両方の姿勢分布を効果的にモデル化でき、曇りのあるシーンにおける各モードごとの不確実性を報告できる。
  • 本手法はモダリティを越えて良好に一般化され、画像ベースの再ロケリゼーションおよび点群ベースのオブジェクト姿勢推定の両方で優れた性能を示した。
  • 6次元回転表現とビンギング混合モデルの使用により、SO(3)における不連続性を回避する安定で連続的な最適化が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。