[論文レビュー] DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition
DirecFormerは、動画フレームの正しい時系列順序を明示的にモデル化することで、行動認識におけるロバスト性を向上させる、新しいTransformerベースのフレームワークを提案する。空間的および時間的次元における方向性注意を組み込み、自己教師付きガイド損失を用いることで、従来手法よりも顕著に低い推論コストでKinetics-400でSOTA(トップ1正解率82.75%)を達成した。
Human action recognition has recently become one of the popular research topics in the computer vision community. Various 3D-CNN based methods have been presented to tackle both the spatial and temporal dimensions in the task of video action recognition with competitive results. However, these methods have suffered some fundamental limitations such as lack of robustness and generalization, e.g., how does the temporal ordering of video frames affect the recognition results? This work presents a novel end-to-end Transformer-based Directed Attention (DirecFormer) framework for robust action recognition. The method takes a simple but novel perspective of Transformer-based approach to understand the right order of sequence actions. Therefore, the contributions of this work are three-fold. Firstly, we introduce the problem of ordered temporal learning issues to the action recognition problem. Secondly, a new Directed Attention mechanism is introduced to understand and provide attentions to human actions in the right order. Thirdly, we introduce the conditional dependency in action sequence modeling that includes orders and classes. The proposed approach consistently achieves the state-of-the-art (SOTA) results compared with the recent action recognition methods, on three standard large-scale benchmarks, i.e. Jester, Kinetics-400 and Something-Something-V2.
研究の動機と目的
- シャッフルされたり、誤った順序に並べ替えられた動画フレームに対して、既存の行動認識モデルがロバストでないという問題に対処すること。
- モデルが時系列順序を是正することで、認識精度を向上させられるかどうかを調査すること。
- 空間的および時間的次元における方向性注意を用いて、正しい行動の順序を明示的にモデル化する手法を開発すること。
- 行動クラスとフレーム順序の間の条件付き依存関係を導入することで、一般化性能を向上させること。
- 従来の3D-CNNおよびTransformerベースの手法と比較して、計算コストを低減しつつSOTAの性能を達成すること。
提案手法
- フレームとトークン間の注目度だけでなく、空間的および時間的次元における注目方向を学習する「方向性注目(Directed Attention)」メカニズムを提案する。
- 時間的次元における方向性注目モジュールを導入し、緑(正の相関)と赤(負の相関)の矢印で表される方向性相関を用いて、行動の順序をモデル化する。
- 自己教師付きガイド損失を採用し、注目が正しい時間的方向へ流れるように促すことで、正しいフレーム順序の学習能力を向上させる。
- 推論時にシャッフルされたフレームの順序を是正するために、ハミルトニアンパス探索アルゴリズムを適用し、モデルが正しい順序を再構築できるかを検証する。
- 行動クラスとその正しい時系列順序の両方を同時に学習するための条件付き依存関係モデリング戦略を採用する。
- ImageNet-21Kでの事前学習を用いたエンドツーエンドのTransformerベースのモデルを訓練し、推論時には3つの空間的クロップと1つの時間的クリップのみを用いることで、計算コストを削減する。
実験結果
リサーチクエスチョン
- RQ1動画フレームが元の時間的順序からシャッフルされた場合でも、行動認識モデルは高い正解率を維持できるか?
- RQ2誤って並べ替えられたフレームの時間的順序を、どの程度の精度で是正できるか? その是正によって認識性能が向上するか?
- RQ3空間的および時間的次元に方向性注目を組み込むことで、行動認識におけるロバスト性と精度が向上するか?
- RQ4標準的なソフトマックスまたはコサイン注目と比較して、提案された方向性注目メカニズムは、時間的順序依存性をどの程度うまくモデル化できるか?
- RQ5自己教師付きガイド損失は、動画シーケンスにおける正しい行動順序の学習能力を効果的に向上させられるか?
主な発見
- DirecFormerは、Kinetics-400でSOTAのトップ1正解率82.75%を達成し、TimeSFormer-Lを約2%上回った。
- 3つのビュー(1クリップ×3クロップ)での推論のみで、従来手法が使用する30ビューと比較して顕著に計算コストを低減しながらも、競争力のある性能を維持した。
- 時間的および空間的次元でC-C(コサイン-コサイン)注目を用いることで、最高の性能が得られ、方向性注目の有効性が裏付けられた。
- Jesterにおけるアブレーションスタディでは、提案された方向性注目メカニズムとガイド損失が、標準的な注目メカニズムよりも顕著に認識精度を向上させた。
- 定性的な結果から、モデルが注意マップ上でのハミルトニアンパス検出を用いて、シャッフルされたパーカー動作の動画から正しいフレーム順序を成功裏に再構築できることを確認した。
- TimeSFormerと同程度のモデルサイズおよびGFLOPsを有するにもかかわらず、Kinetics-400、Jester、Something-Something-V2の3つのベンチマークすべてで、DirecFormerがより高い正解率を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。