Skip to main content
QUICK REVIEW

[論文レビュー] Occlusions, Motion and Depth Boundaries with a Generic Network for Disparity, Optical Flow or Scene Flow Estimation

Eddy Ilg, Tonmoy Saikia|arXiv (Cornell University)|Aug 6, 2018
Advanced Vision and Imaging被引用数 8
ひとこと要約

本論文は、FlowNet 2.0を基盤とする単一のネットワークアーキテクチャを用いて、一度の順伝播で視差、オプティカルフロー、オクルージョン、深度/モーショングレアの推定を統合的に行う汎用的ディーブラーニングフレームワークを提案する。オクルージョンと境界の明示的教師あり学習をエンドツーエンドで行うことで、KITTIおよびSintelベンチマークで最先端の性能を達成し、オクルージョン推定の精度が顕著に向上するとともに、推論速度も高速化された。また、より優れたオクルージョン認識特徴抽出により、モーショングレアセグメンテーションとシーンフローの結果も向上した。

ABSTRACT

Occlusions play an important role in disparity and optical flow estimation, since matching costs are not available in occluded areas and occlusions indicate depth or motion boundaries. Moreover, occlusions are relevant for motion segmentation and scene flow estimation. In this paper, we present an efficient learning-based approach to estimate occlusion areas jointly with disparities or optical flow. The estimated occlusions and motion boundaries clearly improve over the state-of-the-art. Moreover, we present networks with state-of-the-art performance on the popular KITTI benchmark and good generic performance. Making use of the estimated occlusions, we also show improved results on motion segmentation and scene flow estimation.

研究の動機と目的

  • 従来の後処理手法では効果的に解決できない、オクルージョン推定とオプティカルフロー/視差推定の相互依存性を解消すること。
  • ディープラーニングベースの対応推定におけるオクルージョンおよびモーショングレア検出の精度を向上させること。
  • タスク固有の再トレーニングを必要とせず、視差、オプティカルフロー、シーンフローの複数タスクに優れた性能を発揮する汎用ネットワークアーキテクチャを開発すること。
  • 明示的なオクルージョン推定が、モーショングレアセグメンテーションやシーンフローエstimatationなどの下流タスクにどのように寄与するかを示すこと。
  • 標準ベンチマークで最先端の性能を維持しつつ、高い推論速度を達成すること。

提案手法

  • FlowNet 2.0を拡張し、複数段階のリファインメントアーキテクチャを採用。一度の順伝播で視差、オプティカルフロー、オクルージョン、深度/モーショングレア境界を出力する。
  • オクルージョン予測のための専用損失ヘッドを導入。真値のオクルージョンマスクを用いて、メインのフローヘッドおよび視差ヘッドとエンドツーエンドで学習する。
  • 一致コストを視差またはフローエスペース全体にわたってモデル化するため、相関層と3次元畳み込みを用いたコストボリュームを採用。その後に残差リファインメントブロックを適用。
  • オクルージョンマスクをネットワークが直接予測することで、実際の応用では信頼性が低いとされるバックワードフロー整合性に依存しなくなる。
  • スパースおよびデュースな視差推定をサポート。予測されたオクルージョンを活用する新しい補間モジュールを導入し、シーンフロー推定の精度を向上。
  • 複数のデータセットで学習し、KITTでファインチューニングすることで最適な性能を達成。また、他のデータセットに対しても強いゼロショット一般化性能を示した。

実験結果

リサーチクエスチョン

  • RQ11つのディープニューラルネットワークが、後処理手法よりも高い精度でオクルージョンとモーション/視差フィールドを同時に予測できるか?
  • RQ2明示的なオクルージョン推定は、モーショングレアセグメンテーションやシーンフローエステーションなどの下流タスクの性能にどのように寄与するか?
  • RQ3オクルージョンとオプティカルフロー/視差のエンドツーエンドで統合的なトレーニングを実施した場合、ベンチマーク性能および推論速度にどのような影響を与えるか?
  • RQ4汎用ネットワークアーキテクチャが、ドメイン固有のファインチューニングなしに、複数のタスク(視差、オプティカルフロー、シーンフロー)で最先端の結果を達成できるか?
  • RQ5本手法は、オクルージョン境界検出精度およびランタイム効率の観点で、既存の最先端手法と比較してどのように差をつけるか?

主な発見

  • ファインチューニングを施した場合、KITTI 2015ベンチマークでテストセットにおいて平均エンドポイント誤差(AEE)1.19を達成し、以前の手法を上回る最先端の性能を発揮した。
  • Sintelベンチマークでは、クリーンシーケンスでAEE 2.08、ファイナルシーケンスでAEE 3.94を達成。FlowNet2と同等の性能を示しながら、著しく高速であった。
  • KITTI 2015の非オクルージョン領域において、誤差が3pxを超える外れ値の割合を3.45%まで低減し、信頼性の高い領域における優れた精度を示した。
  • 予測されたオクルージョンを入力として用いることで、モーショングレアセグメンテーションの性能が顕著に向上した。これは、オクルージョン認識特徴が物体境界検出を強化していることを示している。
  • 予測されたオクルージョンを活用したシーンフロー推定は、KITTIベンチマークでF1-allスコア11.34%を達成し、1フレームあたり0.25秒の高速な実行時間で、先行手法を大きく上回った。
  • ネットワークはドメイン間で良好に一般化し、ファインチューニングを行わないバージョンでもSintelおよびKITTIの両方で強力な性能を示した。これは、分布シフトに対して高いロバスト性を有していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。