Skip to main content
QUICK REVIEW

[論文レビュー] LiteFlowNet3: Resolving Correspondence Ambiguity for More Accurate Optical Flow Estimation

Tak-Wai Hui, Chen Change Loy|arXiv (Cornell University)|Jul 18, 2020
Advanced Vision and Imaging参考文献 30被引用数 4
ひとこと要約

LiteFlowNet3 は、信頼度マップでガイドされた適応的アフィン変換を用いて、外れ値で満たされたコストボリュームを補正するコストボリュームモデレーションと、類似した特徴を持つ近隣の位置からのより正確なフローに置き換えることで、不正確なフローを一貫性のある近隣のフローに置き換えるフローフィールド変形という2つの新規モジュールを導入することで、光流推定を向上させた。本手法は、Sintel および KITTI ベンチマークで最先端の精度を達成するとともに、小型なモデルサイズ(HD3 より 7.7 倍小さい)と高速な推論(2.2 倍速い)を維持している。

ABSTRACT

Deep learning approaches have achieved great success in addressing the problem of optical flow estimation. The keys to success lie in the use of cost volume and coarse-to-fine flow inference. However, the matching problem becomes ill-posed when partially occluded or homogeneous regions exist in images. This causes a cost volume to contain outliers and affects the flow decoding from it. Besides, the coarse-to-fine flow inference demands an accurate flow initialization. Ambiguous correspondence yields erroneous flow fields and affects the flow inferences in subsequent levels. In this paper, we introduce LiteFlowNet3, a deep network consisting of two specialized modules, to address the above challenges. (1) We ameliorate the issue of outliers in the cost volume by amending each cost vector through an adaptive modulation prior to the flow decoding. (2) We further improve the flow accuracy by exploring local flow consistency. To this end, each inaccurate optical flow is replaced with an accurate one from a nearby position through a novel warping of the flow field. LiteFlowNet3 not only achieves promising results on public benchmarks but also has a small model size and a fast runtime.

研究の動機と目的

  • オクルージョンや均一な画像領域による対応のあいまいさを解消する。
  • フロー復元精度を低下させるコストボリューム内の外れ値の影響を低減する。
  • 粗〜細かい推論における誤ったフローを、局所的なフローの一貫性を活用して補正することで、フロー精度を向上させる。
  • パブリックベンチマークで高い性能を維持しながら、モデルサイズと推論時間を最小限に抑える。
  • HD3 らのような大規模モデルで一般的なアーチファクトを回避する、軽量で効率的なネットワークを開発する。

提案手法

  • 信頼度マップを用いて、コストボリューム内の各コストベクトルに適応的アフィン変換を適用し、信頼性の低いフロー領域を特定する。
  • 信頼度マップを用いて、モodulation パrameter の生成をガイドし、不確実性が高い領域にのみ補正が行われるよう保証する。
  • 各フローを、類似した特徴を持つ近隣の位置からのより正確なフローに置き換える、新規のメタワープメカニズムを導入する。
  • 自己相関コストボリュームを用いて変位フィールドを計算し、メタワープをガイドする。同じ信頼度マップを用いてエラーの局所化を行う。
  • コストボリュームモデレーションとフローフィールド変形を粗〜細かいフレームワークに統合し、逐次的にフローパredictionを精緻化する。
  • FlyingChairs でエンドツーエンドの学習を行い、Sintel および KITTI のベンチマーク性能を向上させるために微調整を行う。

実験結果

リサーチクエスチョン

  • RQ1曇りのない特徴マッチングによって生じるコストボリュームの外れ値を、ディープ光流ネットワークで効果的に軽減する方法は何か?
  • RQ2局所的なフロー一貫性は、不適切な対応領域における光流推定精度をどの程度向上させ得るか?
  • RQ3信頼度マップは、コストボリュームモデレーションとフローフィールド変形の精度を向上させ得るか?
  • RQ4提案手法は、HD3 や PWC-Net といった最先端手法と比較して、精度、モデルサイズ、推論速度の観点でどの程度優れているか?
  • RQ5両モジュールの統合は、多様なデータセットにおいて、光流推定の性能に相乗効果をもたらすか?

主な発見

  • Sintel Final(トレーニングセット)では 3.91% の AEE を達成し、PWC-Net+(4.02%)と IRR-PWC(4.09%)を上回り、HD3 より 7.7 倍小さいモデルサイズを実現した。
  • KITTI 2015 では 10.40% の AEE を達成し、HD3(10.65%)と SelFlow(10.70%)を上回ったが、2 フレームでの学習のみを用いた。
  • アブレーションスタディにより、コストボリュームモデレーションとフローフィールド変形(CMFD)を組み合わせた場合が最良のパフォーマンスを示し、CM 個別に比べて KITTI 2015 で AEE を 0.25% 減少させた。
  • 信頼度マップは両モジュールの精度を著しく向上させる。無効化すると、Sintel Final で AEE が 0.07 上昇し、KITTI 2015 でも同様に 0.07 上昇し、エラーの局所化におけるその役割が明確になった。
  • 可視化結果から、CMFD が Sintel における緑色アーチファクトを効果的に除去し、特にウィンドウガラスや看板などの複雑な構造物周辺で欠落していたフローを補填していることが示された。
  • LiteFlowNet3 は IRR-PWC より 2.2 倍速く(180ms)、HD3 より 7.7 倍小さい(39.9M パラメータ)ながら、すべてのベンチマークで優れた精度を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。