Skip to main content
QUICK REVIEW

[論文レビュー] RelPose: Predicting Probabilistic Relative Rotation for Single Objects in the Wild

Jason Zhang, Deva Ramanan|arXiv (Cornell University)|Aug 11, 2022
Advanced Vision and Imaging被引用数 8
ひとこと要約

本稿では、野生の単一オブジェクトの画像間の確率的相対回転を予測するトップダウン型でエネルギーに基づく手法RelPoseを提案する。この手法により、スパarsな視点からのロバストなカメラポーズ推定が可能となり、最小限の入力で一貫性のあるマルチビュー再構築が実現される。相対回転の多モード分布をエネルギーに基づくネットワークでモデル化し、結合尤度を最適化することで、スパースデータにおいてSfMおよびSLAMのベースラインを上回り、未学習のカテゴリにも一般化可能である。

ABSTRACT

We describe a data-driven method for inferring the camera viewpoints given multiple images of an arbitrary object. This task is a core component of classic geometric pipelines such as SfM and SLAM, and also serves as a vital pre-processing requirement for contemporary neural approaches (e.g. NeRF) to object reconstruction and view synthesis. In contrast to existing correspondence-driven methods that do not perform well given sparse views, we propose a top-down prediction based approach for estimating camera viewpoints. Our key technical insight is the use of an energy-based formulation for representing distributions over relative camera rotations, thus allowing us to explicitly represent multiple camera modes arising from object symmetries or views. Leveraging these relative predictions, we jointly estimate a consistent set of camera rotations from multiple images. We show that our approach outperforms state-of-the-art SfM and SLAM methods given sparse images on both seen and unseen categories. Further, our probabilistic approach significantly outperforms directly regressing relative poses, suggesting that modeling multimodality is important for coherent joint reconstruction. We demonstrate that our system can be a stepping stone toward in-the-wild reconstruction from multi-view datasets. The project page with code and videos can be found at https://jasonyzhang.com/relpose.

研究の動機と目的

  • 一般のオブジェクトのスパースで未ポーズ化された画像から、現実世界の設定において正確なカメラ視点を推定する課題に対処すること。
  • スパースで重複が少ない画像条件下で失敗する、対応ベースのSfMおよびSLAM手法の限界を克服すること。
  • 標準的なオブジェクトポーズを必要とせず、相対カメラ回転を学習することで、少数の画像からのロバストなマルチビュー3D再構築を可能にすること。
  • オブジェクトの対称性や曖昧な視点に起因する相対回転の不確実性と多様性を、確率的定式化を用いてモデル化すること。
  • 神経3D再構築手法がカメラポーズを必要とする場合に、スケーラブルで一般化可能な初期化を提供すること。

提案手法

  • 本手法は、画像ペア間の候補となる相対回転の非正規化対数尤度(エネルギー)を予測するエネルギーに基づくニューラルネットワークを用い、ポーズの曖昧性を確率的モデル化可能である。
  • 相対回転はオブジェクト中心の標準ポーズに依存しない、ビューに合わせた座標系で計算されることで、一般化性能が向上する。
  • 2次元画像ペア間のエネルギー予測から導かれる結合尤度を最大化することで、複数の画像にわたるカメラ回転を同時に最適化する。
  • 回転行列の位置符号化とアンチエイリアシングを施したResNet-50を用いて画像および回転特徴を抽出し、MLPによる特徴融合でエネルギー得点を予測する。
  • 直接回帰とは異なり、相対回転の複数モード(例:90°対称性を持つオブジェクトでは4モード)を学習による多モード分布として明示的にモデル化する。
  • オブジェクトが正面を向いていると仮定して変位を初期化し、回転の一貫性を活用することで、スパースビュー再構築をブートストラップする。

実験結果

リサーチクエスチョン

  • RQ1スパースで重複が少ない画像からカメラポーズを推定する際、データ駆動型トップダウン的手法が、対応ベースのSfMおよびSLAM手法を上回ることができるか?
  • RQ2相対回転を確率的で多様性を持つ分布としてモデル化することで、直接回帰と比較して、結合ポーズの一貫性が向上するか?
  • RQ3本手法は、トレーニング時に見られなかった新しいオブジェクトカテゴリにも一般化可能か、特に対称性や複雑な外観を持つものについても有効か?
  • RQ4従来のSfMの仮定が崩れる変形性や非剛体オブジェクトに対して、本システムはどの程度効果的に動作するか?
  • RQ5エネルギーに基づく定式化は、曖昧な視点や低テクスチャの視点において、どの程度ロバストな推論を可能にするか?

主な発見

  • RelPoseは、スパースな画像セットにおいて、最先端のSfMおよびSLAM手法(例:DROID-SLAM、COLMAP)を上回り、画像数が20未満の状況でも顕著な性能向上を示す。
  • 本手法は、トレーニングデータに含まれない新しいオブジェクトカテゴリに対しても一般化可能であり、未学習のカテゴリのインスタンスにおいても優れた性能を発揮する。
  • エネルギーに基づく学習による多モード相対回転のモデル化は、直接回帰と比較して、はるかに一貫性のある結合カメラポーズ推定を実現する。
  • 本システムは回転対称性を的確に捉えており、例として長方形オブジェクトでは4モード、対称的なマグカップでは2モードを予測するなど、曖昧性に対して強い。
  • ネコやソファなど変形性のあるオブジェクトに対しても、妥当で一貫性のある相対回転予測を生成しており、外観の変動に耐性があることが示された。
  • 定性的な結果から、本手法は対称モードを正しく特定し、たとえばハンドルしか見えないような曖昧な状況でも誤った単一モード予測を避けることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。