[論文レビュー] FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow Estimation
本稿では、マスクドコストボリュームオートエンコーディング(MCVA)を用いた自己教師付き事前学習手法であるFlowFormer++を提案する。ブロック共有マスキングと長距離再構成の事前テスクを導入することで、MCVAはコストボリュームエンコーダーがグローバルなコンテキストを捉える能力を向上させ、Sintel Cleanで1.07のAEPE、KITTI-2015で4.52のF1-allを達成し、FlowFormerに比べてそれぞれ7.76%および7.18%の誤差低減を実現し、最先端の性能を達成した。
FlowFormer introduces a transformer architecture into optical flow estimation and achieves state-of-the-art performance. The core component of FlowFormer is the transformer-based cost-volume encoder. Inspired by the recent success of masked autoencoding (MAE) pretraining in unleashing transformers' capacity of encoding visual representation, we propose Masked Cost Volume Autoencoding (MCVA) to enhance FlowFormer by pretraining the cost-volume encoder with a novel MAE scheme. Firstly, we introduce a block-sharing masking strategy to prevent masked information leakage, as the cost maps of neighboring source pixels are highly correlated. Secondly, we propose a novel pre-text reconstruction task, which encourages the cost-volume encoder to aggregate long-range information and ensures pretraining-finetuning consistency. We also show how to modify the FlowFormer architecture to accommodate masks during pretraining. Pretrained with MCVA, FlowFormer++ ranks 1st among published methods on both Sintel and KITTI-2015 benchmarks. Specifically, FlowFormer++ achieves 1.07 and 1.94 average end-point error (AEPE) on the clean and final pass of Sintel benchmark, leading to 7.76\% and 7.18\% error reductions from FlowFormer. FlowFormer++ obtains 4.52 F1-all on the KITTI-2015 test set, improving FlowFormer by 0.16.
研究の動機と目的
- コストボリュームにマスクドオートエンコーディングを適用する際、隣接する入力画素のコストマップ間に高い相関関係があるため、ランダムマスキングによって情報漏洩れが生じるという限界を是正すること。
- 実際のフローエstimatationにおけるデコーディングプロセスを模倣する再構成タスクを設計することで、事前学習と微調整の乖離を低減すること。
- タスク固有のマスキングおよび再構成戦略を通じて、コストボリュームエンコーダーの長距離情報集約能力を向上させること。
- 教師ありの監視信号や非教師ありの損失に依存せずに、コストボリュームエンコーダーの有効な自己教師付き事前学習を可能にすること。
- 事前学習中に画像エンコーダーを固定することが、訓練の崩壊を防ぎ、安定した再構成ターゲットを維持するために不可欠であることを示すこと。
提案手法
- 隣接する入力画素をブロックにグループ化し、各ブロック内におけるすべてのコストマップに同じマスクパターンを適用するブロック共有マスキング戦略を導入することで、空間的に相関のあるコスト値に起因する情報漏洩れを低減する。
- 微調整時に使用される動的クエリメカニズムに整合するように、小さな$9\times9$のクロップドパッチから大きな$15\times15$のコストパッチを再構成する、新しい事前テスク再構成タスクを提案する。
- 事前学習中にマスクされた入力を処理できるように、トランスフォーマーに基づくコストボリュームエンコーダーにマスクドコストボリュームを統合することで、FlowFormerアーキテクチャを変更する。
- 再構成ターゲット(元のコスト値)を安定化させるために、事前学習中に画像エンコーダーを固定する。
- 全体の性能向上を図り、コストボリューム学習の目的関数に干渉しないように、事前学習中にコンテキストエンコーダーも固定する。
- エンコーダーがマスク領域を、未マスクで遠く離れたコスト特徴を用いて推論できるように再構成タスクを設計することで、長距離特徴の抽象化を促進する。
実験結果
リサーチクエスチョン
- RQ1コストボリュームに高い空間的相関性があるにもかかわらず、マスクドオートエンコーディングを光学的フロー推定におけるコストボリュームエンコーダーの事前学習に効果的に適応できるか?
- RQ2ブロック共有マスキング戦略は、ランダムマスキングと比較して情報漏洩れを防止し、長距離特徴学習を向上させるか?
- RQ3実際のデコーディングプロセスを模倣する再構成タスクは、事前学習と微調整の乖離を低減し、下流の性能を向上させるか?
- RQ4事前学習中に画像エンコーダーを固定することが、訓練の安定性と性能を維持するために必要不可欠であるか?
- RQ5光度計的および滑らかさの損失を用いた非教師あり事前学習と比較して、提案されたMCVA事前学習方式は最終的なフローエstimatation精度において優れているか?
主な発見
- FlowFormer++はSintel Cleanベンチマークで1.07の平均エンドポイント誤差(AEPE)を達成し、FlowFormerに比べて7.76%の相対的誤差低減を実現した。
- Sintel Finalパスでは1.94のAEPEを達成し、FlowFormerに比べて7.18%の相対的改善を示した。
- KITTI-2015テストセットでは4.52のF1-allを達成し、FlowFormerに比べて0.16の改善を示した。
- ブロック共有マスキング戦略はランダムマスキングよりも優れた性能を示し、Sintel Cleanでは0.90のAEPE(ランダムマスキング時:0.93)を達成した。
- 50%のマスキング比が、再構成の難易度と特徴抽象化能力のバランスを最適化し、全体的な性能が最も高くなった。
- 事前学習中に画像エンコーダーとコンテキストエンコーダーの両方を固定することで、安定した訓練と性能向上が達成され、画像エンコーダーの固定が発散を防ぐために不可欠であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。