Skip to main content
QUICK REVIEW

[論文レビュー] FlowFormer: A Transformer Architecture for Optical Flow

Zhaoyang Huang, Xiaoyu Shi|arXiv (Cornell University)|Mar 30, 2022
Advanced Vision and Imaging被引用数 16
ひとこと要約

FlowFormerは、4次元コストボリュームを交互グループ自己注意を用いてコン pact でグローバルに注意を払う潜在トークンにエンコードし、再帰的Transformerと動的位置クエリを用いて流れ予測をデコードする、光学的流れ推定のための新しいTransformerベースのアーキテクチャを提案する。Sintel(クリーンパスで1.159のAEPE)で最先端の性能を達成し、Sintelのファインチューニングなしで強いゼロショット一般化性能を示し、先行手法よりも15.5%の誤差低減を達成した。

ABSTRACT

We introduce optical Flow transFormer, dubbed as FlowFormer, a transformer-based neural network architecture for learning optical flow. FlowFormer tokenizes the 4D cost volume built from an image pair, encodes the cost tokens into a cost memory with alternate-group transformer (AGT) layers in a novel latent space, and decodes the cost memory via a recurrent transformer decoder with dynamic positional cost queries. On the Sintel benchmark, FlowFormer achieves 1.159 and 2.088 average end-point-error (AEPE) on the clean and final pass, a 16.5% and 15.5% error reduction from the best published result (1.388 and 2.47). Besides, FlowFormer also achieves strong generalization performance. Without being trained on Sintel, FlowFormer achieves 1.01 AEPE on the clean pass of Sintel training set, outperforming the best published result (1.29) by 21.7%.

研究の動機と目的

  • 先行手法で用いられる well-established なコストボリューム表現を効果的に活用するTransformerベースの光学的流れネットワークの設計を目的とする。
  • 標準的なTransformerを4次元コストボリュームに直接適用する計算上の非現実性を克服するため、コンパクトで効率的なトークナイゼーションおよび注意メカニズムを導入することを目的とする。
  • 新規な交互グループ注意メカニズムを用いてコスト特徴量内の長距離依存関係をモデル化することで、流れ推定の精度と一般化性能を向上させることを目的とする。
  • rawピクセルを処理するのではなく、コストボリュームとTransformerを統合することで、優れた性能とパラメータ効率が得られることを示すこと。

提案手法

  • 4次元コストボリューム内の各2次元コストマップをパッチにトークナイズし、各パッチをK個の潜在トークンに投影することで、4次元ボリュームをH×W×K個のトークンに縮小する。
  • 同じソースピクセルのコストマップ内で自己注意を交互に適用し、異なるソースピクセル間でも自己注意を適用する、交互グループTransformer(AGT)レイヤーを採用することで、グローバルなコンテキストモデリングを可能にする。
  • AGTレイヤーによって生成されるコストメモリは、全コストボリュームのコンパクトでグローバルに注意を払う表現であり、流れ関連の情報を保持している。
  • 再帰的Transformerデコーダーは、現在の流れ推定に基づいて更新される動的位置コストクエリを用い、コストメモリ上のクロス注意をガイドする。
  • デコーダーは共有されたゲート付き再帰ユニット(GRU)ヘッドを用いて、反復的に流れの残差を回帰することで、精度を段階的に向上させる。
  • 画像特徴エンコーダーは、オプションとしてImageNet事前学習済みのビジョンTransformer(Twins-SVT)に置き換え可能であり、標準的なCNNよりも性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1計算効率を維持したまま、4次元コストボリュームを効果的に処理できるTransformerベースのアーキテクチャは実現可能か?
  • RQ2新規な注意メカニズムを用いてコスト特徴量内の長距離依存関係をモデル化することで、局所的ウィンドウベースの手法と比較して流れ推定の精度が向上するか?
  • RQ3コストボリュームのコンパクトな潜在表現が、十分な情報を保持し、大規模なパrameter化の必要を減らすことができるか?
  • RQ4コストボリュームとTransformerを統合することで、先行手法と比較して、データセット間でのゼロショット一般化性能が向上するか?

主な発見

  • Sintelクリーンパスでは1.159の平均エンドポイント誤差(AEPE)を達成し、前回の最良結果(1.388)と比較して16.5%の誤差低減を達成した。
  • Sintelファイナルパスでは2.088のAEPEを達成し、前回の最先端(2.47)と比較して15.5%の誤差低減を達成した。
  • Sintelでのファインチューニングなしで、Sintelクリーンパスで1.01のAEPEを達成し、最高の公表済み結果(1.29)を21.7%の誤差低減で上回った。
  • K=4、D=32、AGT×1のより小さな構成でも、GMAをすべての指標で上回り、パrameter数を超えるアーキテクチャ的優位性を示した。
  • GMAのCNNエンコーダーをFlowFormerで使用した同じImageNet事前学習済みのTwins-SVTに置き換えても、Sintelクリーンパスで僅か15%の誤差低減にとどまるが、FlowFormerは依然として15%低い誤差を達成しており、設計の優位性を裏付けた。
  • アブレーションスタディにより、AGTレイヤーとコストメモリ表現が性能向上に顕著に寄与することが確認され、AEPEはAGTレイヤー数が0から3に増加するにつれて低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。