[論文レビュー] PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle Adjustment
PoseDiffusionは、2次元の対応点から得られる幾何的制約を確率的拡散プロセスに統合することで、繰り返しカメラ姿勢を精緻化する、拡散ベースのフレームワークを提案する。CO3Dv2およびRealEstate10kで最先端の精度を達成し、特にスパarsely観点や挑戦的な状況において、古典的SfM手法や学習ベース手法を上回る性能を発揮する。
Camera pose estimation is a long-standing computer vision problem that to date often relies on classical methods, such as handcrafted keypoint matching, RANSAC and bundle adjustment. In this paper, we propose to formulate the Structure from Motion (SfM) problem inside a probabilistic diffusion framework, modelling the conditional distribution of camera poses given input images. This novel view of an old problem has several advantages. (i) The nature of the diffusion framework mirrors the iterative procedure of bundle adjustment. (ii) The formulation allows a seamless integration of geometric constraints from epipolar geometry. (iii) It excels in typically difficult scenarios such as sparse views with wide baselines. (iv) The method can predict intrinsics and extrinsics for an arbitrary amount of images. We demonstrate that our method PoseDiffusion significantly improves over the classic SfM pipelines and the learned approaches on two real-world datasets. Finally, it is observed that our method can generalize across datasets without further training. Project page: https://posediffusion.github.io/
研究の動機と目的
- スパarsely観点や広基準基準の状況において、古典的Structure-from-Motion (SfM) パipelaineの限界を克服すること。
- エピポール幾何学からの幾何的制約を深層学習フレームワークに統合し、より優れた姿勢推定を実現すること。
- バンドル調整を模倣する微分可能で反復的な精緻化プロセスを構築すること。ただし、拡散モデルのインダクティブバイアスを組み込む。
- 自由形式の画像コレクションから、外挿パラメータおよび内挿パラメータをエンドツーエンドで予測可能にする。
提案手法
- カメラ姿勢推定を、入力画像集合Iとカメラ姿勢xの条件付き分布p(x|I)を学習する問題として定式化する。
- 前向きな拡散プロセスを逆方向に実行することで、ノイズの多いカメラ姿勢推定値を繰り返し精緻化する、ノイズ除去U-Netアーキテクチャを用いる。
- サンプリング中にエピポール制約を強制するために、2次元画像間対応点を介した幾何的ガイドを統合し、幾何的一致性を向上させる。
- 拡散モデルの条件付けに使用される画像埋め込みを生成するため、マルチスケール特徴抽出器(例:DINO ViT-S16)を採用する。
- 幾何的制約を用いた分類器フリー・ガイドランスを適用し、より一貫性があり正確な姿勢解へのサンプリングを促進する。
- 既知のカメラ姿勢を持つ大規模データセット上で自己教師あり学習を実施し、未学習のシーンへの一般化を可能にする。
実験結果
リサーチクエスチョン
- RQ1拡散ベースのフレームワークは、カメラ姿勢推定における複雑で凸でない最適化領域(バンドル調整)を効果的にモデル化できるか?
- RQ22次元対応点からの幾何的制約の統合は、拡散ベースの姿勢推定の精度と一貫性をどのように向上させるか?
- RQ3微調整なしに、学習済み拡散モデルはデータが少ない状況でも、さまざまなデータセットやシーンタイプに一般化可能か?
- RQ4本手法は、スパarselyおよび密な視点設定の両方において、古典的SfMパイプラインおよび学習ベースのベースラインを上回るか?
- RQ5対称的またはテクスチャが乏しいシーンにおいて、背景のコンテキストはどれほど姿勢推定の精度に寄与するか?
主な発見
- PoseDiffusionはDINO ViT-S16バックボーンを用いてCO3Dv2で66.5 mAA(30)を達成し、ResNet50および教師ありResNet50を上回る性能を示した。
- 100枚以上のフレームを用いる状況では、COLMAP+SPSGと同等の性能を発揮したが、COLMAPは真値アノテーションにアクセス可能であった。
- 100ステップ(T=100)で最適な性能が得られ、100ステップを超えても顕著な向上は認められなかった。
- 背景ピクセルをマスクするとmAA(30)が57.0に低下し、背景コンテキストが姿勢推定に顕著に寄与することが示された。
- 微調整なしにデータセット間で一般化可能であり、強力なゼロショット一般化能力を示した。
- PoseDiffusionはNeRFのトレーニングの監視を向上させ、外挿および内挿カメラパラメータ推定の両面で優れた精度を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。