Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Deep Epipolar Flow for Stationary or Dynamic Scenes

Yiran Zhong, Pan Ji|arXiv (Cornell University)|Apr 8, 2019
Advanced Vision and Imaging参考文献 43被引用数 5
ひとこと要約

本稿では、静的シーンにおける低ランク構造と動的シーンにおける部分空間の和というグローバルな幾何的制約を、ソフトエピポラ制約を用いて強制する、教師なし深層学習手法であるDeep Epipolar Flowを提案する。この手法は、KITTI 2015(Fl 16.24%)およびSintel(CleanでのEPE 6.84)で最先端の性能を達成し、教師なし手法としての優位性を示し、真値フローサポートが不要な状態で教師ありベースラインに近い性能に到達する。

ABSTRACT

Unsupervised deep learning for optical flow computation has achieved promising results. Most existing deep-net based methods rely on image brightness consistency and local smoothness constraint to train the networks. Their performance degrades at regions where repetitive textures or occlusions occur. In this paper, we propose Deep Epipolar Flow, an unsupervised optical flow method which incorporates global geometric constraints into network learning. In particular, we investigate multiple ways of enforcing the epipolar constraint in flow estimation. To alleviate a "chicken-and-egg" type of problem encountered in dynamic scenes where multiple motions may be present, we propose a low-rank constraint as well as a union-of-subspaces constraint for training. Experimental results on various benchmarking datasets show that our method achieves competitive performance compared with supervised methods and outperforms state-of-the-art unsupervised deep-learning methods.

研究の動機と目的

  • 繰り返し模様やオクルージョンが生じる領域において、教師なし深層オプティカルフロー手法の性能が低下する問題に対処すること。
  • 真値フローサポートに依存せずに、教師なしフローラーニングにグローバルなエピポラ幾何を組み込むこと。
  • 複数の運動が存在する動的シーンにおける「もつれ問題(chicken-and-egg problem)」を、低ランクおよび部分空間の和の制約を用いてシーン幾何をモデル化することで克服すること。
  • 教師なし学習フレームワークにおいて幾何的事前知識を統合することで、静的および動的シーンの両方における汎化性と精度を向上させること。

提案手法

  • 静的シーンにおけるグローバル剛性を強制するために、低ランク構造に基づくソフトエピポラ制約を導入する。
  • 動的シーンにおける複数の独立した運動をモデル化するため、剛体な基本行列の仮定に代わる部分空間の和の制約を提案する。
  • これらの制約を用いてエピポラ幾何を強制する微分可能損失関数を設計し、教師なし学習中に適用する。
  • 画像ワープ損失、滑らかさ正則化、幾何的制約を統合した一貫性のある学習目的関数を構築する。
  • 真値フローサポートが不要なエンドツーエンド学習を可能にする、ピラミッドベースのCNNアーキテクチャを用いた2フレーム入力方式を採用する。
  • 実世界データセット(KITTI VO)におけるファインチューニングを実施し、ドメイン固有のフローパターンに適応させる。

実験結果

リサーチクエスチョン

  • RQ1教師なし深層オプティカルフロー学習において、オクルージョンや繰り返し模様のような困難な領域の性能向上に、グローバルなエピポラ幾何を効果的に強制できるか?
  • RQ2複数の運動が存在する動的シーンでは、1つの基本行列がなぜ失敗するのか。そして、このような複雑さをよりよくモデル化する代替的な幾何的構造は何か?
  • RQ3低ランクおよび部分空間の和の制約を、真値フローサポートが不要な状態で、柔軟で微分可能な正則化子として用いることは可能か?
  • RQ4幾何的事前知識を組み込むことで、単にフォトメトリック損失および滑らかさ正則化のみを用いる場合と比較して、収束が速くなり、誤差が低減するか?

主な発見

  • KITTI 2015ベンチマークでは、エンドポイント誤差(EPE)が5.56、フローアクキュラシー(Fl)が16.24%を達成し、以前の最先端教師なし手法Back2Future Flowを上回った。
  • Sintel Cleanデータセットでは、EPEが6.84を記録し、教師なし手法の中での最高性能を達成し、教師ありモデルの性能に近づいた。
  • 部分空間の和の制約により、低ランクまたはハードな基本行列制約と比較して、複数の運動を有する動的シーンの処理がより効果的に行えるようになった。
  • アブレーションスタディの結果、画像ワープ損失と部分空間制約を組み合わせた場合、Sintel Finalデータセットにおいて他の組み合わせと比較して収束が早く、検証誤差も低かった。
  • KITTI 2015およびSintel Finalデータセットでのファインチューニングにより性能が向上し、Sintelの結果はEPEが6.15から3.94に低下した。これはドメイン適応の恩恵を示している。
  • ファインチューニング後は、SpyNetなどの教師ありネットワークと比較しても競争力のある性能を示し、実世界および合成ドメインへの汎化性が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。