[論文レビュー] FlowCam: Training Generalizable 3D Radiance Fields without Camera Poses via Pixel-Aligned Scene Flow
FlowCam は、微分可能レンダリングを介して 2D 光学フローを 3D スポーツフローに変換し、重み付き最小二乗法による SE(3) カメラポーズ推定を用いて、未校正の動画からエンドツーエンドで自己教師ありの 3D レンダランスフィールドを学習可能にする。本手法は、真値のポーズや深度マップを必要とせず、多様な現実世界のデータセット、特に自然な動画においても、耐障害性の高い新規ビュー合成と正確なカメラポーズ推定を達成する。
Reconstruction of 3D neural fields from posed images has emerged as a promising method for self-supervised representation learning. The key challenge preventing the deployment of these 3D scene learners on large-scale video data is their dependence on precise camera poses from structure-from-motion, which is prohibitively expensive to run at scale. We propose a method that jointly reconstructs camera poses and 3D neural scene representations online and in a single forward pass. We estimate poses by first lifting frame-to-frame optical flow to 3D scene flow via differentiable rendering, preserving locality and shift-equivariance of the image processing backbone. SE(3) camera pose estimation is then performed via a weighted least-squares fit to the scene flow field. This formulation enables us to jointly supervise pose estimation and a generalizable neural scene representation via re-rendering the input video, and thus, train end-to-end and fully self-supervised on real-world video datasets. We demonstrate that our method performs robustly on diverse, real-world video, notably on sequences traditionally challenging to optimization-based pose estimation techniques.
研究の動機と目的
- 真値のカメラポーズを必要とせず、整理されていない動画から一般化可能な 3D ニューラルシーン表現を自己教師ありで学習することを目的とする。
- 構造から姿勢を求める(SfM)手法のスケーラビリティのボトルネックを解消するため、ポーズ依存性をエンドツーエンドの微分可能最適化に置き換えること。
- 微分可能レンダリングと頑健なポーズフィッティングを用いて、1回の順伝播でカメラトラジェクトリと 3D シーンジオメトリを同時に推定すること。
- SLAM が失敗するような困難なシーケンスを含め、分布外のシーンに対してもゼロショット一般化を達成するカメラポーズ推定を実現すること。
- 動的コンテンツや歪みを含む自然な動画に対して、フォワードパスによる新規ビュー合成とカメラポーズ推定を可能にすること。
提案手法
- 微分可能レンダリングを用いて、フレーム間の 2D 光学フローを 3D スポーツフローに変換し、空間的局所性とシフト不変性を保持する。
- 3D スポーツフロー場に重み付き最小二乗法ソルバーを適用して SE(3) カメラポーズを推定し、重みはフロー信頼度から導出する。
- ポーズ推定と 3D 再構築の両方でニューラルシーン表現の重みを共有し、同時に最適化を可能にする。
- 再レンダリング損失を唯一の監視信号として用い、実動画における完全な自己教師あり学習を実現する。
- テスト時微調整を適用して、真値の監視がなくてもポーズドリフトを低減し、ジオメトリの詳細を向上させる。
- フローキャンフィデンス重み付けを組み込み、遮蔽、鏡面反射、動的物体に起因する信頼性の低い対応を低減する。
実験結果
リサーチクエスチョン
- RQ1微分可能レンダリングを用いて、動画と僅かな情報のみで真値のカメラポーズなしに 3D レンダランスフィールドを学習可能か?
- RQ2ピクセルに整合した 3D スポーツフローを用いて、微分可能かつエンドツーエンドの方法で正確で頑健なカメラトラジェクトリを推定可能か?
- RQ31回の順伝播で 3D シーンを再構築し、カメラポーズを同時に推定でき、分布外のシーケンスに対しても強い一般化性能を示せるか?
- RQ4動的コンテンツや歪みを含む現実世界の自然な動画に対して、本手法はどのように性能を発揮するか?
- RQ5微調整や事前計算された SfM ポーズなしで、新規ビュー合成およびポーズ推定において競争力のある性能を達成できるか?
主な発見
- CO3D ハイドラントデータセットでは、FlowCam の完全モデルが 21.02 dB の PSNR と 0.38 の LPIPS を達成し、フローウェイトなしや直接ポーズ予測のアブレーションを上回る性能を示した。
- ウォーキングツアーおよび Ego4D データセットでは、20~1.5 時間のテスト時微調整後、それぞれ ATE が 0.013 および 0.026 を達成した。
- ORB-SLAM3 が失敗するシーケンスに対してもゼロショット一般化が可能であり、回転が激しくて特徴が乏しいトラジェクトリに対しても頑健であることが示された。
- フローキャンフィデンス重み付けは、遮蔽や動的物体に起因する信頼性の低い対応を効果的に低減し、耐障害性を向上させた。
- 7 時間のテスト時最適化後、FlowCam は最小限のドリフトでジオメトリを再構築し、視覚的に魅力的な新規ビュー合成を実現した。
- アブレーションスタディにより、フローに基づくポーズ定式化が不可欠であることが確認され、直接の CNN ベースのポーズ予測や非重み付きプロクラウステスフィッティングではジオメトリが劣化した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。