Skip to main content
QUICK REVIEW

[論文レビュー] CRAFT: Cross-Attentional Flow Transformer for Robust Optical Flow

Xiuchao Sui, Shaohua Li|arXiv (Cornell University)|Mar 31, 2022
Advanced Vision and Imaging被引用数 8
ひとこと要約

CRAFTは、大規模な変位と運動ぼかしの下でノイズを低減し、耐性を向上させるために、意味的スムージングTransformerとクロスフレームアテンションを用いて相関ボリュームの計算を向上させる、新しい光流画像ネットワークを提案する。Sintel(Final)およびKITTI(前景)ベンチマークにおいて、敵対的画像シフト攻撃(大規模な運動を模擬)の下でもRAFTやGMAを上回る最先端の性能を達成している。

ABSTRACT

Optical flow estimation aims to find the 2D motion field by identifying corresponding pixels between two images. Despite the tremendous progress of deep learning-based optical flow methods, it remains a challenge to accurately estimate large displacements with motion blur. This is mainly because the correlation volume, the basis of pixel matching, is computed as the dot product of the convolutional features of the two images. The locality of convolutional features makes the computed correlations susceptible to various noises. On large displacements with motion blur, noisy correlations could cause severe errors in the estimated flow. To overcome this challenge, we propose a new architecture "CRoss-Attentional Flow Transformer" (CRAFT), aiming to revitalize the correlation volume computation. In CRAFT, a Semantic Smoothing Transformer layer transforms the features of one frame, making them more global and semantically stable. In addition, the dot-product correlations are replaced with transformer Cross-Frame Attention. This layer filters out feature noises through the Query and Key projections, and computes more accurate correlations. On Sintel (Final) and KITTI (foreground) benchmarks, CRAFT has achieved new state-of-the-art performance. Moreover, to test the robustness of different models on large motions, we designed an image shifting attack that shifts input images to generate large artificial motions. Under this attack, CRAFT performs much more robustly than two representative methods, RAFT and GMA. The code of CRAFT is is available at https://github.com/askerlee/craft.

研究の動機と目的

  • 大規模な変位と運動ぼかしの下で、相関ボリュームがノイズが多く不適切な一致によって汚染されるという、正確な光流推定の課題に対処すること。
  • 特徴の意味的性質を強化し、一致の前にノイズをフィルタリングすることで、相関ボリューム計算の耐性を向上させること。
  • 畳み込み特徴一致におけるドット積相関の限界を克服すること。これは、局所的なテクスチャの損失やぼかしに対して感受性が強い。
  • トランスフォーマーに基づく特徴スムージングとクロスアテンション機構が、光流推定における不適切な相関を顕著に低減できることを検証すること。

提案手法

  • 単一フレーム内で自己アテンションを適用し、相関計算の前に特徴をグローバルにスムージングおよび意味的に安定化させる、意味的スムージングトランスフォーマー(SST)レイヤーを導入する。
  • 従来のドット積相関を、クエリとキーの投影を用いてノイズの多い特徴をフィルタリングし、より正確なフレーム間類似度を計算するクロスフレームアテンション機構に置き換える。
  • アブレーションスタディにより、両方のフレームにSSTを適用すると追加のノイズが生じることを示しており、片方のフレームにのみ適用することでノイズを回避する。
  • RAFTに類似したマルチスケールのフロー精錬ヘッドを採用しているが、提案されたコンponentsによる強化された相関ボリュームを活用する。
  • 大規模な人工的な運動を模擬するための新しい画像シフト攻撃を採用し、極端な変位とぼかし下での耐性を評価する。
  • ビジョントランスフォーマーの特性を活用し、画像全体にわたる意味的に類似し、文脈的に関連するピクセルに注目することで、特徴をノイズ除去する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーに基づく特徴スムージング機構は、ぼやけた画像やテクスチャの多い画像において、光流相関ボリュームのノイズを低減し、一致精度を向上させることができるか?
  • RQ2ドット積相関をクロスフレームアテンションに置き換えることで、運動ぼかしや大規模な変位下でもより耐性があり正確なフロー推定が可能になるか?
  • RQ3RAFT や GMA といった最先端手法と比較して、提案された CRAFT アーキテクチャは、人工的な大規模な運動および画像劣化に対してどの程度耐性があるか?
  • RQ4入力フレームの両方に意味的スムージングトランスフォーマーを適用した場合の影響は何か?なぜ性能が低下するのか?
  • RQ5可視化されたヒートマップから、提案されたコンponentsが相関ボリューム内の不適切な相関をどの程度低減しているか?

主な発見

  • CRAFTはSintel(Final)ベンチマークで新たな最先端性能を達成し、平均エンドポイント誤差(AEPE)の観点でRAFTやGMAを顕著に上回っている。
  • KITTI(前景)ベンチマークでは、評価されたすべての手法の中で最高の結果を達成しており、実世界のシナリオへの汎用性が強いことを示している。
  • 画像シフト攻撃(Δu ∈ [100,300])により大規模な変位を模擬した状況下でも、CRAFTは低AEPEを維持しているが、RAFTやGMAはΔu = 160を超えると著しく性能が低下している。
  • Sintel(Final)で運動ぼかしを加えた状況下での可視化により、CRAFTが計算する相関ボリュームには、RAFT や GMA よりも顕著に少ない不適切な一致が存在することが確認された。
  • 両フレームにSSTを適用した(ダブルSST)場合、不適切な相関が増加し、性能が低下することが示された。これは、単一フレームのスムージングが最適であることを示している。
  • Slow Flowデータセット(運動ぼかしあり)におけるCRAFTのAEPEは、Sintelでの値よりわずかに35ピクセル高いが、RAFT や GMA は80〜100ピクセルも上昇しており、CRAFTのぼかしに対する耐性が証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。