Skip to main content
QUICK REVIEW

[論文レビュー] Learning Rigidity in Dynamic Scenes with a Moving Camera for 3D Motion Field Estimation

Zhaoyang Lv, Kihwan Kim|arXiv (Cornell University)|Apr 12, 2018
Advanced Vision and Imaging参考文献 26被引用数 12
ひとこと要約

本稿では、動くカメラで撮影された動的シーンにおいて、3次元運動場(シーンフロー)推定を向上させるために、剛性とカメラモーションを同時に推定する深層学習フレームワークを提案する。半実装RGB-Dデータセット(REFRESH)を活用することで、画素単位の剛性マスクを予測し、オプティカルフローと剛性領域を用いて自己移動運動を精緻化する。非剛性運動が顕著な挑戦的な動的シーンにおいて、最先端手法を上回る性能を発揮する。

ABSTRACT

Estimation of 3D motion in a dynamic scene from a temporal pair of images is a core task in many scene understanding problems. In real world applications, a dynamic scene is commonly captured by a moving camera (i.e., panning, tilting or hand-held), increasing the task complexity because the scene is observed from different view points. The main challenge is the disambiguation of the camera motion from scene motion, which becomes more difficult as the amount of rigidity observed decreases, even with successful estimation of 2D image correspondences. Compared to other state-of-the-art 3D scene flow estimation methods, in this paper we propose to \emph{learn} the rigidity of a scene in a supervised manner from a large collection of dynamic scene data, and directly infer a rigidity mask from two sequential images with depths. With the learned network, we show how we can effectively estimate camera motion and projected scene flow using computed 2D optical flow and the inferred rigidity mask. For training and testing the rigidity network, we also provide a new semi-synthetic dynamic scene dataset (synthetic foreground objects with a real background) and an evaluation split that accounts for the percentage of observed non-rigid pixels. Through our evaluation we show the proposed framework outperforms current state-of-the-art scene flow estimation methods in challenging dynamic scenes.

研究の動機と目的

  • 動くカメラで撮影された動的シーンにおいて、カメラの運動とシーンの運動を区別する課題に対処すること。
  • 画像ペアに深度情報を含めた状態で、画素単位の剛性を学習することで、3次元運動場(シーンフロー)推定を向上させること。
  • 実際の背景と合成された非剛性の前景を組み合わせた、スケーラブルな半実装データセット(REFRESH)を構築し、より良い監視と一般化を可能とすること。
  • 学習された剛性を2次元オプティカルフローと統合することで、自己移動運動と投影されたシーンフローの正確な推定を可能とすること。

提案手法

  • 順次的なRGB-D画像ペアを処理する2ストリームニューラルネットワークアーキテクチャが、剛性マスクと相対的なカメラポーズを同時に予測する。
  • 剛性マスクを用いて、剛性領域内の密なフローコルレスポンダに最小二乗最適化を適用することで、推定されたカメラポーズを精緻化する。
  • フローリファインメントモジュールが剛性マスクとオプティカルフローを活用し、3次元運動場計算の対応精度を向上させる。
  • 本手法は、実際の静止背景と合成された非剛性の人間の動きを組み合わせた半実装データセット(REFRESH)を用い、剛性、深度、フロー、ポーズの正確な真値を提供する。
  • 大規模な動的シーンデータ上で教師あり学習によりフレームワークを訓練し、RGB-D入力からエンドツーエンドでシーンフローを予測可能とする。
  • 本手法は、非剛性画素の割合を考慮した新しいテストスプリットを用いて評価され、さまざまなシーンダイナミクス下での公平な比較が可能となる。

実験結果

リサーチクエスチョン

  • RQ1動くカメラで撮影された動的シーンにおいて、深層ニューラルネットワークが画素単位の剛性を効果的に予測し、3次元運動場推定を向上させることができるか?
  • RQ2半実装データから学習した剛性の予測が、ノイズやブレーキングを伴う実世界のRGB-Dシーケンスにどの程度一般化されるか?
  • RQ3剛性に配慮したポーズ精緻化を組み込むことで、最先端手法と比較してシーンフローの精度がどの程度向上するか?
  • RQ4学習された剛性マスクは、幾何的事前知識やクラスタリングに依存する従来手法を上回ることができるか?
  • RQ5特にシーンのわずかな部分しか剛性でない場合、非剛性運動の度合いが変化する条件下で、本フレームワークはどの程度の性能を示すか?

主な発見

  • 本手法は、SintelおよびTUM RGB-Dベンチマークにおいて、最先端のシーンフロー推定手法を上回り、特に動的コンテンツが豊富なシーンで顕著な性能向上を示した。
  • Sintelデータセットでは、平均RPE(t)が0.0091、RPE(r)が0.0020を達成し、ORB-SLAM(0.0894および0.0218)やSRSF(0.0980および0.0180)を著しく上回った。
  • REFRESHデータセットで訓練された剛性マスクは、平均IOUが0.956を達成し、Things3Dで訓練されたモデル(0.286)やセマンティック剛性ベースラインと比較して優れた一般化性能を示した。
  • 本手法は、TUMシーケンスのノイズのある実世界RGB-Dデータに対しても良好に一般化し、ブレーキングや深度ノイズが存在する中でも妥当な剛性予測とシーンフローを生成した。
  • アブレーションスタディの結果、微調整なしの本フレームワークがすべての最先端手法を上回り、ポーズ推定およびシーンフロー予測の精度が最も高かった。
  • 本フレームワークは、小規模またはゆっくり動く物体を含む挑戦的なシナリオにおいても頑健であることが示され、剛性予測の誤差が最小限に抑えられ、3次元運動場の品質が著しく低下しなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。