Skip to main content
QUICK REVIEW

[論文レビュー] ProFlow: Learning to Predict Optical Flow

Daniel Maurer, Andrés Bruhn|arXiv (Cornell University)|Jun 3, 2018
Advanced Vision and Imaging参考文献 13被引用数 11
ひとこと要約

ProFlowは、時間的に逐次的に、畳み込みニューラルネットワーク(CNN)を用いて、後方から前方の光流を学習することで、空間的に変化する運動モデルを予測する非教師あり、オンライン学習手法を提案する。従来の方法が事前学習済みモデルや剛体運動の仮定に依存するのに対し、ProFlowはフレームごとに適応し、遮蔽領域や非剛体運動における性能を向上させ、MPI Sintelでは最先端の結果を達成し、KITTIおよびSintelベンチマークで一貫して27%の向上を達成した。

ABSTRACT

Temporal coherence is a valuable source of information in the context of optical flow estimation. However, finding a suitable motion model to leverage this information is a non-trivial task. In this paper we propose an unsupervised online learning approach based on a convolutional neural network (CNN) that estimates such a motion model individually for each frame. By relating forward and backward motion these learned models not only allow to infer valuable motion information based on the backward flow, they also help to improve the performance at occlusions, where a reliable prediction is particularly useful. Moreover, our learned models are spatially variant and hence allow to estimate non-rigid motion per construction. This, in turns, allows to overcome the major limitation of recent rigidity-based approaches that seek to improve the estimation by incorporating additional stereo/SfM constraints. Experiments demonstrate the usefulness of our new approach. They not only show a consistent improvement of up to 27% for all major benchmarks (KITTI 2012, KITTI 2015, MPI Sintel) compared to a baseline without prediction, they also show top results for the MPI Sintel benchmark -- the one of the three benchmarks that contains the largest amount of non-rigid motion.

研究の動機と目的

  • 既存の光流推定手法が剛体運動モデルや事前学習済みネットワークに依存するため、遮蔽領域や非剛体運動に対処できないという限界を是正すること。
  • 現在のシーケンスから直接運動モデルを学習することで、非剛体かつ非自己運動の状況においても時間的整合性を活用すること。
  • 学習された空間的に変化するマッピングを用いて、後方光流から前方光流を予測することで、遮蔽領域における流れ推定を向上させること。
  • 大規模な真値データセットの必要性を回避するため、シーケンス自体の初期光流推定値を用いて、非教師ありでオンラインで運動モデルを学習すること。
  • 特にMPI Sintelのような挑戦的な非剛体運動シナリオにおいて、主要ベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、光流推定プロセス中に、非教師ありでオンラインで、後方光流から前方光流への空間的に変化するCNNベースのマッピングを学習する。
  • 運動モデルは、同じシーケンスからの初期前方および後方光流推定値を用いて、フレームごとに逐次的に訓練され、外部データセットへの依存を回避する。
  • 本手法は、後方光流を入力として前方光流を予測する。これにより、一貫性が保たれ、遮蔽領域における信頼性が向上する。
  • ハード制約が適用される:後方光流が有効な情報を持つ領域では、予測された前方光流が元の前方光流に置き換えられる。特に遮蔽領域で有効である。
  • 予測後に、インpaintingと最適化を用いたリファインメントステップを組み込むことで、さらに光流品質を向上させる。
  • 真値データなしでエンドツーエンドに学習され、前方と後方光流の整合性のみを教師信号として使用する。

実験結果

リサーチクエスチョン

  • RQ1現在のシーケンスの光流推定値から、非教師ありでオンラインでCNNベースの運動モデルを効果的に学習できるか?
  • RQ2このような学習された空間的に変化する運動モデルは、遮蔽領域や非剛体運動領域における光流推定を向上させられるか?
  • RQ3提案手法は、特に非剛体運動シナリオにおいて、予測なしのベースライン手法を上回る性能を示せるか?
  • RQ4本手法は、ステレオやSfMの制約に依存せずに、標準的な光流ベンチマークで最先端の性能を達成できるか?
  • RQ5本手法の性能は、シーン内容や運動の複雑さの変化に伴ってどのようにスケーリングするか?

主な発見

  • ProFlowは、ベースラインに予測なしの手法を用いた場合に比べ、すべての主要ベンチマーク(KITTI 2012, KITTI 2015, MPI Sintel)で27%の相対的向上を達成した。
  • MPI Sintelベンチマークでは、セマンティックまたは幾何的制約を用いた手法を含むすべての手法の中で最高の結果を達成した。
  • KITTI 2012では4.49%のOut-All誤差、KITTI 2015では13.86%のFl-bg誤差を記録し、PWC-Net や UnFlow を上回った。
  • MPI Sintel finalでは5.017の全誤差を記録し、Scene Flowを除くすべての手法の中で第1位となった。
  • 挑戦的な非剛体運動領域において一貫した向上を示し、MPI Sintel unmatchedスプリットでは24.736の誤差で、他に類を見ない性能を発揮した。
  • 1226×370解像度のシーケンスあたりの実行時間は約112秒で、そのうち50秒が運動モデルの学習と予測に割り当てられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。