Skip to main content
QUICK REVIEW

[論文レビュー] Learning Optical Flow via Dilated Networks and Occlusion Reasoning

Yi Zhu, Shawn Newsam|arXiv (Cornell University)|May 7, 2018
Advanced Vision and Imaging参考文献 14被引用数 3
ひとこと要約

本稿では、拡張畳み込みとオクルージョン推論を用いた教師なし光流推定手法を提案する。これにより、マルチスケール処理の向上とグリッドアーチファクトの低減が達成される。デコンボリューションの代わりに拡張畳み込みを採用し、密なスキップ接続を統合することで、高分解能特徴を保持し、KITTIベンチマークで最先端の性能を達成する。F1-all誤差は2.35%、アクション認識の正確さは82.5%を達成した。

ABSTRACT

Despite the significant progress that has been made on estimating optical flow recently, most estimation methods, including classical and deep learning approaches, still have difficulty with multi-scale estimation, real-time computation, and/or occlusion reasoning. In this paper, we introduce dilated convolution and occlusion reasoning into unsupervised optical flow estimation to address these issues. The dilated convolution allows our network to avoid upsampling via deconvolution and the resulting gridding artifacts. Dilated convolution also results in a smaller memory footprint which speeds up interference. The occlusion reasoning prevents our network from learning incorrect deformations due to occluded image regions during training. Our proposed method outperforms state-of-the-art unsupervised approaches on the KITTI benchmark. We also demonstrate its generalization capability by applying it to action recognition in video.

研究の動機と目的

  • 教師なし光流推定における限界、特にマルチスケール処理、グリッドアーチファクト、オクルージョン推論の改善。
  • 分解能の損失とグリッドアーチファクトを回避するため、デコンボリューションへの依存を低減するが、高分解能特徴マップを維持する。
  • 前向き・後向き一致性を明示的にモデル化することで、オクルージョンを扱い、学習の安定性と正確さを向上させる。
  • 真値光流を必要としないまま、アクション認識などの下流タスクへの汎化性能を向上させる。
  • リアルタイムの推論速度を維持しながら、実世界のベンチマークで高い正確さを達成する。

提案手法

  • 最終層でデコンボリューションによるアップサンプリングを、拡張畳み込みに置き換えることで、空間分解能を保持し、グリッドアーチファクトを回避する。
  • 後続の畳み込みブロック(conv3_1、conv4_1、conv5_1)で、拡張率2および4の拡張畳み込みを適用し、ダウンサンプリングを行わずに受容 field を拡大する。
  • 層間の密なスキップ接続を統合することで、特徴の伝搬を向上させ、特に小さな物体の微細な動きを捉える。
  • 光度的一致性と明度一定性に基づく教師なし学習目的関数を用い、非オクルージョン領域でのみ勾配を逆伝播する。
  • 前向き・後向き光流の一致性を用いたオクルージョン推論を統合:前向きと後向きの光流が一致する領域でのみ勾配を更新する。
  • 真値光流を必要とせず、画像再構成損失を用いてエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1デコンボリューションによるアップサンプリングを避けることで、拡張畳み込みがマルチスケール光流推定にどのように寄与するか?
  • RQ2前向き・後向き一貫性によるオクルージョン推論は、教師なし光流推定をどのように改善するか?
  • RQ3拡張畳み込みと密な接続によって高分解能特徴を保持することで、光流の正確さはどの程度向上するか?
  • RQ4真値光流を用いずに学習した教師なし光流モデルは、アクション認識などの下流タスクに強い汎化性能を示せるか?
  • RQ5本手法は、KITTI 2012 や KITTI 2015 といった実世界のベンチマークで、既存の教師なしベースラインを上回るか?

主な発見

  • 提案手法は、KITTI 2015ベンチマークで2.35%のF1-all誤差を達成し、最先端の教師なし手法を上回った。
  • KITTI 2012では1.56%のF1-all誤差を報告し、従来の教師なしアプローチよりも顕著に向上した。
  • UCF101アクション認識ベンチマークでは82.5%のトップ-1正確さを達成し、真値光流を必要としないにもかかわらず、FlowNet2 や FlowFields を上回った。
  • モデルは33.3 fpsで実行され、リアルタイム推論を可能にし、FlowNet2(8 fps)や FlowFields(0.06 fps)を上回った。
  • 拡張畳み込みの使用により、メモリ使用量が削減され、デコンボリューションベースの手法と比較してグリッドアーチファクトが完全に排除された。
  • オクルージョン推論の統合により、オクルージョン領域および非オクルージョン領域の両方で、オクルージョン非対応モデルと比較して誤差率が50%以上低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。