Skip to main content
QUICK REVIEW

[論文レビュー] VideoFlow: Exploiting Temporal Cues for Multi-frame Optical Flow Estimation

Xiaoyu Shi, Zhaoyang Huang|arXiv (Cornell University)|Mar 15, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

VideoFlowは、TRiフレーム光学フロー(TROF)モジュールとMOtion Propagation(MOP)モジュールを用いて、時間的手がかりを活用することで、複数の連続する動画フレームの双方向光学フローを同時に推定する画期的な光学フロー枠組みを提案する。最先端の性能を達成し、Sintel finalおよびcleanパスでは15.1%および7.6%の誤差低減を達成し、KITTI-2015では19.2%の誤差低減を示し、すべてのベンチマークで1位を獲得した。

ABSTRACT

We introduce VideoFlow, a novel optical flow estimation framework for videos. In contrast to previous methods that learn to estimate optical flow from two frames, VideoFlow concurrently estimates bi-directional optical flows for multiple frames that are available in videos by sufficiently exploiting temporal cues. We first propose a TRi-frame Optical Flow (TROF) module that estimates bi-directional optical flows for the center frame in a three-frame manner. The information of the frame triplet is iteratively fused onto the center frame. To extend TROF for handling more frames, we further propose a MOtion Propagation (MOP) module that bridges multiple TROFs and propagates motion features between adjacent TROFs. With the iterative flow estimation refinement, the information fused in individual TROFs can be propagated into the whole sequence via MOP. By effectively exploiting video information, VideoFlow presents extraordinary performance, ranking 1st on all public benchmarks. On the Sintel benchmark, VideoFlow achieves 1.649 and 0.991 average end-point-error (AEPE) on the final and clean passes, a 15.1% and 7.6% error reduction from the best-published results (1.943 and 1.073 from FlowFormer++). On the KITTI-2015 benchmark, VideoFlow achieves an F1-all error of 3.65%, a 19.2% error reduction from the best-published result (4.52% from FlowFormer++). Code is released at \url{https://github.com/XiaoyuShi97/VideoFlow}.

研究の動機と目的

  • 既存の光学フロー手法が2フレーム推定に限定されており、追加の隣接フレームからの貴重な時間的手がかりを無視しているという制限に対処すること。
  • 複数フレームの双方向光学フローを同時に推定する統一フレームワークを開発し、より優れた動きモデリングと耐性を実現すること。
  • より広い時間的文脈を活用することで、オクルージョンや境界外ピクセルなどの困難な領域における曖昧さを低減し、フローの正確性を向上させること。
  • 動的動き伝搬を用いて3フレーム推定をより長い動画シーケンスに拡張可能なスケーラブルなアーキテクチャを設計すること。

提案手法

  • TRiフレーム光学フロー(TROF)モジュールは、中央フレームからその直前および直後のフレームへの双方向光学フローを同時に推定し、時間的に同じピクセルで動き特徴が整合されるように保証する。
  • TROFは、共有の特徴空間内で双方向フローパレットと相関特徴を統合することで、反復的に動き特徴を精緻化する再帰的統合メカニズムを用いる。
  • MOtion Propagation(MOP)モジュールは、動き状態特徴$\mathbf{M}_{t}^{k}$を用いて、予測されたフローパathに沿って動き特徴を伝搬させることで、複数のTROFユニットを接続する。
  • MOPにより、反復処理に伴い時間的受容場が拡大され、遠く離れたフレームからの情報が微分可能かつ動的にフローパレット予測に影響を与えるようになる。
  • モデルは再帰的デコーダー内で反復的精製を実行し、現在のフローエstimatesに基づいて隣接するTROFユニット間で動き特徴をワープする。
  • モデルは標準的な光学フロー損失関数を用いてエンド・ツー・エンドで訓練され、双方向フローパレット予測は設計上対称的であり、一貫性が向上する。

実験結果

リサーチクエスチョン

  • RQ1中心フレームから双方向フローを同時に推定することで、2フレーム手法における不整合に起因する誤差を低減し、動きの一貫性を向上させることができるか?
  • RQ2複数フレームからの時間的文脈を効果的に統合することで、オクルージョンや曖昧な領域におけるフローパレット推定を改善できるか?
  • RQ3複数のTROFユニット間で動き特徴を効率的に伝搬させる最適な方法は何か? これにより3フレーム推定をより長い動画シーケンスに拡張可能になるか?
  • RQ4伝搬中に動き状態特徴を維持することで、単純な特徴伝達よりも性能が向上するか?
  • RQ5マルチフレーム光学フロー枠組みは、Sintel や KITTI-2015 などの標準ベンチマークで、最先端の2フレームモデルを上回ることができるか?

主な発見

  • Sintel finalパスでは1.649の平均エンドポイント誤差(AEPE)を達成し、前回最良結果の1.943から15.1%の誤差低減を達成した。
  • Sintel cleanパスでは0.991のAEPEを達成し、前回最良結果の1.073から7.6%の誤差低減を達成した。
  • KITTI-2015ベンチマークでは3.65%のF1-all誤差を達成し、前回最良結果の4.52%から19.2%の誤差低減を達成した。
  • アブレーションスタディにより、TROFにおける双方向フロー推定と再帰的統合が性能向上に顕著に寄与することが確認され、特に後者はSintel finalパスでAEPEを0.07低下させた。
  • 動き状態特徴伝搬を有するMOPモジュールが最良の性能を達成し、ナードな特徴伝達ベースラインと比較して、KITTI-2015でF1-all誤差を1.3%低減した。
  • 双方向フロー予測は対称的かつ高精度であり、前方および後方フローの両方が類似したAEPE値を示しており、モデルの一貫性と耐性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。