Skip to main content
QUICK REVIEW

[論文レビュー] Every Pixel Counts: Unsupervised Geometry Learning with Holistic 3D Motion Understanding

Zhenheng Yang, Peng Wang|arXiv (Cornell University)|Jun 27, 2018
Advanced Vision and Imaging参考文献 50被引用数 10
ひとこと要約

本論文は、カメラ自己運動、ピixe レベルの3次元オブジェクト運動(シーンフロー)、および動的オブジェクトセグメンテーションを統合的にモデル化することで、単眼深度推定および3次元運動理解を向上させる自己教師付きフレームワークを提案する。微分可能で包括的な3次元運動解析器(HMP)を用い、光学的フロー、深度予測、カメラポーズ、セグメンテーションマスクを統合して一貫性を強制することで、KITTI 2015において深度、シーンフロー、動的オブジェクトセグメンテーションの分野で最先端の性能を達成した。

ABSTRACT

Learning to estimate 3D geometry in a single image by watching unlabeled videos via deep convolutional network has made significant process recently. Current state-of-the-art (SOTA) methods, are based on the learning framework of rigid structure-from-motion, where only 3D camera ego motion is modeled for geometry estimation.However, moving objects also exist in many videos, e.g. moving cars in a street scene. In this paper, we tackle such motion by additionally incorporating per-pixel 3D object motion into the learning framework, which provides holistic 3D scene flow understanding and helps single image geometry estimation. Specifically, given two consecutive frames from a video, we adopt a motion network to predict their relative 3D camera pose and a segmentation mask distinguishing moving objects and rigid background. An optical flow network is used to estimate dense 2D per-pixel correspondence. A single image depth network predicts depth maps for both images. The four types of information, i.e. 2D flow, camera pose, segment mask and depth maps, are integrated into a differentiable holistic 3D motion parser (HMP), where per-pixel 3D motion for rigid background and moving objects are recovered. We design various losses w.r.t. the two types of 3D motions for training the depth and motion networks, yielding further error reduction for estimated geometry. Finally, in order to solve the 3D motion confusion from monocular videos, we combine stereo images into joint training. Experiments on KITTI 2015 dataset show that our estimated geometry, 3D motion and moving object masks, not only are constrained to be consistent, but also significantly outperforms other SOTA algorithms, demonstrating the benefits of our approach.

研究の動機と目的

  • 既存の自己教師付き深度推定手法が剛体シーンを仮定するという制限を克服するため、動的で非剛体なオブジェクトを明示的にモデル化すること。
  • ピixe レベルの3次元シーンフローとオクルージョンに配慮した運動モデリングを組み込むことで、深度推定の安定性と正確性を向上させること。
  • 深度、光学的フロー、カメラ運動、動的オブジェクトセグメンテーションを統合的に最適化する一貫性のある微分可能なフレームワークを構築すること。
  • 単眼動画における深度-運動の曖昧さを解消するため、トレーニングプロセスにステレオ画像ペアを統合すること。
  • すべてのピクセルの運動を明示的に説明できる包括的な3次元シーン理解を実現し、ビュー合成における光度誤差を低減すること。

提案手法

  • 2次元光学的フロー、予測されたカメラポーズ、深度マップ、動的オブジェクトセグメンテーションマスクを統合する包括的3次元運動解析器(HMP)を導入する。
  • カメラポーズとターゲット深度を用いて剛体背景の3次元運動を計算する一方で、光学的フローと両方の深度を用いてオクルージョンを考慮した全画像3次元シーンフローを計算する。
  • 微分可能な制約を課す:剛体領域でオクルージョンがなく、背景の3次元フローと全3次元フローの差がゼロであるべきであり、動的オブジェクト領域では空間的に滑らかな残差が非ゼロであるべきである。
  • これらの制約に基づいてマルチタスク損失を設計し、深度および運動ネットワークをエンドツーエンドで監視する。
  • 深度-運動の曖昧さを解消し一般化性能を向上させるために、単眼トレーニングパイプラインにステレオ画像ペアを統合する。
  • 単一画像深度予測用の深度ネットワーク、カメラポーズとオブジェクトマスク用の運動ネットワーク、および補助的監視信号としての光学的フロー ネットワークを備えた2ストリームアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1ピixe レベルの3次元オブジェクト運動を明示的にモデル化することで、動的オブジェクトを含む単眼動画における自己教師付き深度推定が向上するか?
  • RQ2光学的フロー、深度、カメラ運動の間の3次元運動の一貫性をどのように強制することで、トレーニングの安定性と幾何推定の精度が向上するか?
  • RQ3深度、シーンフロー、動的オブジェクトセグメンテーションの共同学習が、個別監視と比較してどの程度性能向上をもたらすか?
  • RQ4ステレオデータを用いることで、単眼自己教師付き学習における深度推定が、深度-運動の曖昧さを解消することで向上するか?
  • RQ5剛体背景と動的オブジェクト運動の両方をモデル化する包括的3次元運動解析器は、より正確で安定した幾何再構成を実現するか?

主な発見

  • 提案手法は、KITTI 2015ベンチマークにおいて、既存の自己教師付きおよび教師あり手法を上回る最先端の性能を達成した。深度、シーンフロー、動的オブジェクトセグメンテーションの分野で優れた結果を示した。
  • HMPモジュールは幾何推定を顕著に向上させ、KITTI 2015のシーンフローベンチマークでD1誤差を23.62、D2誤差を27.38まで低減した。
  • 運動マスクを用いた動的オブジェクトセグメンテーションは、平均IoUが52.25%を達成し、ベースライン手法(例:残留フローにおけるGMMで50.83%、説明可能性マスクで41.95%)を上回った。
  • 背景および動的オブジェクトの両方の3次元運動を明示的にモデル化することで、ビュー合成における光度誤差が低減され、トレーニングがより安定した。
  • ステレオ画像を用いた共同学習は、単眼学習に比べて性能を向上させ、自己教師付き深度学習におけるマルチモodal監視の利点を示した。
  • HMPモジュールを削除するか、単眼データでのみ学習すると、性能が著しく低下し、包括的3次元運動解析の重要性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。