Skip to main content
QUICK REVIEW

[論文レビュー] ActionFormer: Localizing Moments of Actions with Transformers

Chenlin Zhang, Jianxin Wu|arXiv (Cornell University)|Feb 16, 2022
Human Pose and Action Recognition被引用数 15
ひとこと要約

ActionFormer は、局所自己注意と軽量なデコーダーを用いて、ビデオ内のすべての時点を分類し、アクション境界を回帰することで、1段階・アンカーフリーなTransformerモデルを提案する。アクション候補やアンカーウィンドウを必要とせず、THUMOS14 で tIoU=0.5 時に 71.0% の mAP を達成し、先行手法より 14.1 パcent 点の上回りを記録した。

ABSTRACT

Self-attention based Transformer models have demonstrated impressive results for image classification and object detection, and more recently for video understanding. Inspired by this success, we investigate the application of Transformer networks for temporal action localization in videos. To this end, we present ActionFormer -- a simple yet powerful model to identify actions in time and recognize their categories in a single shot, without using action proposals or relying on pre-defined anchor windows. ActionFormer combines a multiscale feature representation with local self-attention, and uses a light-weighted decoder to classify every moment in time and estimate the corresponding action boundaries. We show that this orchestrated design results in major improvements upon prior works. Without bells and whistles, ActionFormer achieves 71.0% mAP at tIoU=0.5 on THUMOS14, outperforming the best prior model by 14.1 absolute percentage points. Further, ActionFormer demonstrates strong results on ActivityNet 1.3 (36.6% average mAP) and EPIC-Kitchens 100 (+13.5% average mAP over prior works). Our code is available at http://github.com/happyharrycn/actionformer_release.

研究の動機と目的

  • アクション候補やアンカーウィンドウに依存しない、シンプルでありながら強力なTransformerベースのモデルを構築すること。
  • 長距離の時系列依存性をモデル化するための局所自己注意と特徴ピラミッド統合の有効性を調査すること。
  • 非トリムドおよびエゴセントリック動画を含む多様なベンチマークで、テンポラルアクションロケライゼーションの強力な1段階ベースラインを確立すること。
  • 標準的な分類および回帰損失を用いたミニマルな設計が、複雑な2段階またはアンカーベースのモデルを上回ることを示すこと。

提案手法

  • ActionFormer は、2ストリーム I3D や SlowFast バックボーンを用いてビデオからマルチスケールの特徴表現を抽出し、その後に特徴ピラミッドを適用して各時点を候補として表現する。
  • 局所自己注意を用いて特徴ピラミッド全体にわたる長距離の時系列的文脈をモデル化し、アクション候補間の依存関係を捉える。
  • 軽量な畳み込みデコーダーを用いて、各候補をアクションカテゴリに分類し、各候補から真のアクション開始時刻および終了時刻までの距離を回帰する。
  • 分類には標準的な交差エントロピー損失、境界回帰にはスムーズL1損失を用い、エンドツーエンドの最適化で学習する。
  • 推論では、予測スコアとオフセットをデコードして、その時間的境界とラベルを持つアクションインスタンスを生成する。
  • この手法は、入力特徴を解像度、フレームレート、モダリティ(例:THUMOS14 では2ストリーム I3D、EPIC-Kitchens では SlowFast)に適応させることで、全データセットに一貫して適用される。

実験結果

リサーチクエスチョン

  • RQ11段階・アンカーフリーなTransformerモデルが、アクション候補や事前定義されたアンカーウィンドウを一切使用せずに、テンポラルアクションロケライゼーションで最先端の性能を達成できるか?
  • RQ2非トリムド動画におけるアクションロケライゼーションにおいて、局所自己注意は長距離の時系列依存性をどの程度効果的にモデル化できるか?
  • RQ3標準的な損失関数を用いたシンプルで統一されたアーキテクチャが、多様なベンチマークで複雑な2段階またはアンカーベースのモデルをどの程度上回れるか?
  • RQ4モデルは、非トリムド、長時間の、およびエゴセントリック動画を含むさまざまな動画ドメインにどの程度一般化できるか?

主な発見

  • ActionFormer は、THUMOS14 ベンチマークで tIoU=0.5 時に 71.0% の mAP を達成し、最良の先行手法より 14.1 パーセントポイントの絶対的向上を示した。
  • ActivityNet 1.3 では、平均 mAP が 36.6% を達成し、長尾分布で多様なアクション分布に強い一般化性能を示した。
  • 挑戦的な EPIC-Kitchens 100 データセットでは、先行手法と比較して平均 mAP が 13.5 パーセントポイント以上向上し、エゴセントリックアクションロケライゼーションにおける有効性を強力に示した。
  • モデルはミニマルな設計でこれらの結果を達成しており、複雑な候補生成やデコーディングパイプラインを一切使用せず、標準的な分類および回帰損失のみを用いた。
  • 広範なアブレーションスタディにより、局所自己注意と特徴ピラミッドの重要性が確認され、これらのコンponentsを除去すると顕著な性能低下が生じた。
  • 異なるハードウェアや環境でも再現可能であり、EPIC-Kitchens では mAP の変動がわずか ≤0.8% にとどまり、モデルの堅牢性と信頼性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。