[論文レビュー] Relation Modeling in Spatio-Temporal Action Localization
本稿では、空間的および時間的次元に跨るトランスフォーマーに基づく関係モデリングを用いた、マルチリレーション性の時空間的アクションローカライゼーションフレームワークを提案する。メモリバンク統合と長尾クラス分布への分離微調整を組み合わせることで、性能が向上している。AVA-Kineticsテストセットでは40.67 mAPを達成し、人物間の相互作用の共同モデリングと、希少なアクションに対する一般化性能の向上により顕著な向上を示している。
This paper presents our solution to the AVA-Kinetics Crossover Challenge of ActivityNet workshop at CVPR 2021. Our solution utilizes multiple types of relation modeling methods for spatio-temporal action detection and adopts a training strategy to integrate multiple relation modeling in end-to-end training over the two large-scale video datasets. Learning with memory bank and finetuning for long-tailed distribution are also investigated to further improve the performance. In this paper, we detail the implementations of our solution and provide experiments results and corresponding discussions. We finally achieve 40.67 mAP on the test set of AVA-Kinetics.
研究の動機と目的
- AVA-Kineticsのような大規模かつ長尾分布を示すビデオデータセットにおける時空間的アクションローカライゼーションの性能向上を目的とする。
- トランスフォーマーに基づくアーキテクチャ内での、空間のみ(S-only)、時間のみ(T-only)、および併用(combined)の複数の関係モデリング戦略の有効性を調査すること。
- 分離微調整とメモリバンク機構を用いることで、希少アクションクラスにおけるモデルの一般化性能を向上させること。
- 人物検出の品質が、後続のアクションローカライゼーション性能に与える影響を評価すること。
- AVAとKineticsの複数データセットを用いた事前学習を、エンドツーエンド学習と統合することで、より高いロバスト性を実現すること。
提案手法
- 2次元人物検出器を用いて人物のバウンディングボックスを生成し、時間方向に膨張させ、3D RoI-Alignを用いてビデオバックボーン(例:SlowFastまたはir-CSN)から3D特徴マップを抽出する。
- 空間的または時間的特徴シーケンスをフラット化し、共有重みのトランスフォーマー畳み込みブロックに通すことで、人物間の関係をモデリングするS-onlyおよびT-only関係ヘッドを適用する。
- 長時間のビデオクリップに跨る人物特徴を格納・更新するためのメモリバンクを導入し、長距離の時間的依存関係のモデリングを向上させる。
- 特徴表現学習の安定化を図るため、モーメンタム更新ルールを用いたオンラインメモリバンク更新戦略を採用する。
- 低リソースのアクションカテゴリにおける性能低下を緩和するため、クラスバランスサンプリングを用いた分離微調整を適用する。
- AVAおよびKineticsデータセット上で、統合的事前学習と転移学習を組み合わせたエンドツーエンド学習を可能にする。
実験結果
リサーチクエスチョン
- RQ1S-onlyおよびT-only関係ヘッドは、時空間的アクションローカライゼーションにおいて、どのように性能を発揮するか?
- RQ2メモリバンクの使用は、動画アクション検出における長距離時間的依存関係のモデリングにどのような影響を与えるか?
- RQ3分離微調整は、頻度の高いクラスの性能を劣化させることなく、長尾アクションカテゴリにおける性能を向上させることができるか?
- RQ4人物検出器の選定が、最終的なアクション検出mAPに与える影響は何か?
- RQ5AVA + Kineticsの複数データセット事前学習は、ターゲットテストセットにおける一般化性能にどの程度寄与するか?
主な発見
- T-only関係ヘッドにメモリバンクを組み合わせた場合、ベースライン比でmAPが約0.8ポイント向上し、長距離時間的モデリングの価値を示した。
- 分離微調整により、最も頻度が低い20個のアクションカテゴリでmAPが1.05ポイント向上し、上位20クラスでは最小限の性能低下にとどまった。
- 15モデルのアンサンブルによる最終結果は、AVA-Kineticsテストセットで40.67 mAPを達成し、バリデーションセットからのmAP低下がたった0.3ポイントにとどまり、優れた一般化性能を示した。
- GTバウンディングボックスを用いることで、AVAではmAPが43.53、Kineticsでは48.49に上昇し、パイプライン全体における人物検出器が主なボトルネックであることが明らかになった。
- Kinetics700で事前学習した場合、Kinetics400に比べてmAPが約1ポイント向上し、時間分解能を2倍にした場合にもmAPが約0.6ポイント向上した。
- 2段階の訓練戦略(最初にAVAで、次にAVA-Kineticsで空のバンクから開始)を採用したモデルが最良の性能を示し、ヘッドを再初期化する戦略を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。