Skip to main content
QUICK REVIEW

[論文レビュー] Joint Unsupervised Learning of Optical Flow and Depth by Watching Stereo Videos

Yang Wang, Zhenheng Yang|arXiv (Cornell University)|Oct 8, 2018
Advanced Vision and Imaging参考文献 18被引用数 14
ひとこと要約

本論文は、幾何的制約と相互監視を活用することで、ステレオ動画から一括してオプティカルフロー、深度、自己運動を教師なしで同時に学習する統合的フレームワークを提案する。静的領域におけるオプティカルフローを、深度と自己運動から得られる剛体フローで監視し、剛体アライメントモジュールを用いて自己運動を精緻化することで、KITTI上で最先端の性能を達成し、従来の教師なし手法と比較してオプティカルフロー誤差を50%削減し、教師ありベースラインと同等の性能を達成した。

ABSTRACT

Learning depth and optical flow via deep neural networks by watching videos has made significant progress recently. In this paper, we jointly solve the two tasks by exploiting the underlying geometric rules within stereo videos. Specifically, given two consecutive stereo image pairs from a video, we first estimate depth, camera ego-motion and optical flow from three neural networks. Then the whole scene is decomposed into moving foreground and static background by compar- ing the estimated optical flow and rigid flow derived from the depth and ego-motion. We propose a novel consistency loss to let the optical flow learn from the more accurate rigid flow in static regions. We also design a rigid alignment module which helps refine ego-motion estimation by using the estimated depth and optical flow. Experiments on the KITTI dataset show that our results significantly outperform other state-of- the-art algorithms. Source codes can be found at https: //github.com/baidu-research/UnDepthflow

研究の動機と目的

  • 動的シーンにおける教師なし深度推定とオプティカルフロー推定の限界を克服するため、ステレオ動画を用いて2つのタスクを連合して学習すること。
  • ステレオペア間の幾何的一致性と時間的運動を活用することで、深度と自己運動推定を向上させること。
  • 静的領域におけるより信頼性の高い剛体フロー(深度と自己運動から導出)を監視信号として用いることで、オプティカルフローの精度を向上させること。
  • オプティカルフロー対応関係を介して点群をアライメントする新しい剛体アライメントモジュールを用いて、自己運動推定を精緻化すること。
  • フローと剛体フローの差異に基づく運動セグメンテーションにより、動く前景と静的背景を区別することで、システム全体のロバストネスを向上させること。

提案手法

  • 2つの連続するステレオ画像ペアから深度、オプティカルフロー、自己運動を同時に推定するため、3つの深層ニューラルネットワークを用いるフレームワーク。
  • 推定されたオプティカルフローと、深度と自己運動から導出される剛体フローを比較することで、動きのある物体を特定する運動セグメンテーションマスクを生成する。
  • フロー整合性モジュールにより、静的領域におけるオプティカルフローが剛体フローと一致するように制約を課し、フロー精度を向上させる。
  • オプティカルフロー対応関係から再構築した3次元点群を剛体的にアライメントすることで、自己運動を精緻化する剛体アライメントモジュールを採用する。
  • 3段階の訓練プロトコルを採用:ステレオ画像のみを用いた深度推定、時間的一致性を考慮した自己運動とフローの精緻化、運動セグメンテーションとモジュール統合を含む完全な連合最適化。
  • 損失関数には、ステレオ一貫性、オプティカルフロー再構成、運動セグメンテーションに配慮した損失を組み合わせ、一般化性能の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1ステレオ動画からの深度とオプティカルフローの連合学習が、幾何的制約を活用することで性能向上を達成できるか?
  • RQ2深度と自己運動から導出される剛体フローを、静的領域におけるオプティカルフロー推定の監視信号としてどのように活用できるか?
  • RQ3オプティカルフローから得られる対応関係を精緻化する剛体アライメントモジュールが、自己運動推定を向上させられるか?
  • RQ4フローと剛体フローの差異に基づく運動セグメンテーションが、システム全体のロバストネスをどの程度向上させるか?
  • RQ5教師あり手法と同等の性能を達成できる教師なしステレオベースの学習が、教師データなしで実現可能か?

主な発見

  • 本手法は、KITTI 2012において、従来の最先端の教師なし手法と比較してオプティカルフロー誤差を50%削減し、教師あり手法と同等の性能を達成した。
  • 本モデルは、KITTI 2015の深度推定において、すべての先行する教師なしステレオベース手法を上回り、平均IoU 0.56、頻度加重IoU 0.88を達成した。
  • 剛体アライメントモジュールは自己運動推定を顕著に向上させ、絶対的軌道誤差を低減し、このモジュールを含まない手法を上回った。
  • フロー整合性モジュールにより、特に平面領域で滑らかで境界が明瞭なオプティカルフロー予測が得られ、定性的な比較で明確に示された。
  • 運動セグメンテーション性能はわずかに向上し、平均IoU 0.56、ピクセル正答率 0.82を達成したが、動的シーンの処理において改善の余地があることが示唆された。
  • アブレーションスタディにより、剛体アライメントモジュールとフロー整合性モジュールの両方が、深度、フロー、オドメトリの各タスクにおいて最適性能を達成するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。