Skip to main content
QUICK REVIEW

[論文レビュー] Extreme Relative Pose Estimation for RGB-D Scans via Scene Completion

Zhenpei Yang, Jeffrey Z. Pan|arXiv (Cornell University)|Dec 31, 2018
Advanced Vision and Imaging参考文献 44被引用数 7
ひとこと要約

本論文は、最小限または完全に重複のないRGB-Dスキャン間の極端な相対姿勢推定を可能にするディーブラーニングフレームワークを提案する。反復的にシーン補完と姿勢推定を交互に繰り返すことで、再帰的ネットワークを用いて幾何的および意味的事前知識を活用し、最先端の性能を達成する。非重複スキャンに対しても意味のある姿勢推定が可能となり、SUNCG、Matterport、ScanNetでそれぞれ79.9°、87.9°、81.8°の平均回転誤差を達成した。

ABSTRACT

Estimating the relative rigid pose between two RGB-D scans of the same underlying environment is a fundamental problem in computer vision, robotics, and computer graphics. Most existing approaches allow only limited maximum relative pose changes since they require considerable overlap between the input scans. We introduce a novel deep neural network that extends the scope to extreme relative poses, with little or even no overlap between the input scans. The key idea is to infer more complete scene information about the underlying environment and match on the completed scans. In particular, instead of only performing scene completion from each individual scan, our approach alternates between relative pose estimation and scene completion. This allows us to perform scene completion by utilizing information from both input scans at late iterations, resulting in better results for both scene completion and relative pose estimation. Experimental results on benchmark datasets show that our approach leads to considerable improvements over state-of-the-art approaches for relative pose estimation. In particular, our approach provides encouraging relative pose estimates even between non-overlapping scans.

研究の動機と目的

  • 特徴ベースの従来手法が対応できないほど対応点が不足する、重複がほとんどないRGB-Dスキャン間の相対姿勢推定の課題に対処すること。
  • 従来手法が大幅なスキャン重複を必要としているという制限を克服するため、シーン補完に基づくアプローチを導入して欠落した幾何構造を推定すること。
  • 構造的事前知識と双方向スキャン補完を活用することで、極端な姿勢状況における姿勢推定の精度を向上させること。
  • 姿勢推定とシーン補完の間で反復的リファインメントが、単一パスまたは非反復的手法よりも優れた性能を発揮することを示すこと。
  • 疎な視点からの3D再構成、SLAMのループ閉じる検出、不完全なスキャンを用いたジグソーパズルの解法など、実用的応用を可能にすること。

提案手法

  • 相対姿勢推定モジュールとバイスキャン補完モジュールを交互に実行する再帰的ニューラルネットワークを導入し、シーン補完と姿勢推定を反復的に最適化する。
  • 補完品質とマッチングのロバスト性を向上させるために、深度、表面法線、意味的記述子を組み合わせた豊富なマルチモodal表現を用いる。
  • スペクトルマッチングとロバストなRANSACベースのフィッティングを統合した新しいペアワイズマッチングモジュールを設計し、ノイズが多いまたは不完全な予測に対応する。
  • 現在の姿勢推定を用いて一方のスキャンを変換し、他方のスキャンと統合することでバイスキャン補完を実行し、より完全なシーン再構築を生成する。
  • 完成したシーンを真値幾何の代理として用い、補完の監視を通じて相対姿勢ネットワークを監視し、一般化性能を向上させる。
  • 補完と姿勢推定の目的関数を組み合わせた微分可能損失関数を用いて、エンドツーエンドのネットワークを訓練し、共同最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1シーン補完は、重複がほとんどない極端な姿勢状況における相対姿勢推定を顕著に改善できるか?
  • RQ2姿勢推定とシーン補完の間で反復的・再帰的なリファインメントプロセスは、単一パスまたは非反復的手法よりも優れた性能を発揮するか?
  • RQ3従来の特徴マッチングが失敗する非重複スキャンにおける相対姿勢推定において、提案手法はどの程度有効か?
  • RQ4幾何的および意味的事前知識は、不完全なスキャン設定下での補完と姿勢推定の精度をどの程度向上させるか?
  • RQ5スペクトルマッチングとロバストフィッティングの統合は、ノイズが多いまたは不完全な予測の状況下で性能をどのように向上させるか?

主な発見

  • 10%以上の重複があるスキャンにおいて、SUNCGでは平均回転誤差を36.6°から12.0°に、Matterportでは42.0°から9.0°に、ScanNetでは51.4°から30.2°に削減した。
  • 非重複スキャンでは、SUNCGで79.9°、Matterportで87.9°、ScanNetで81.8°の平均回転誤差を達成し、予想されるランダム誤差126.3°よりも顕著に優れていた。
  • アブレーションスタディの結果、スキャン補完モジュールを削除すると、重複スキャンでさえも性能が著しく低下し、その必要性が示された。
  • 再帰モジュールを削除すると、すべてのデータセットで性能が劣化し、反復的リファインメントが正確な姿勢および補完結果を達成する上で不可欠であることが明らかになった。
  • 回転推定の誤差分布には90°および180°に集中する傾向が見られ、これは屋内シーンの対称性による曖昧さであり、予想通りで管理可能である。
  • 観測領域からの距離が離れるほど補完品質が低下するが、この影響は反復的リファインメントにより緩和され、特に重複が小さいスキャンで顕著に利益が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。