Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Perception Transformer for Temporal Action Localization

Yizheng Ouyang, Tianjin Zhang|arXiv (Cornell University)|Aug 25, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文は、全動画シーケンス全体の長距離依存関係をモデル化するグローバルパーセプションアテンションと、双方向畳み込みシフトを用いたインtraフレームおよびインタフレームの局所的文脈を捉えることで、アンカーや提案を用いないエンドツーエンドの時系列行動検出フレームワークAdaPerFormerを提案する。THUMOS14では59.3%、ActivityNet-1.3では35.1%の最先端のmAPを達成した。

ABSTRACT

Temporal action localization aims to predict the boundary and category of each action instance in untrimmed long videos. Most of previous methods based on anchors or proposals neglect the global-local context interaction in entire video sequences. Besides, their multi-stage designs cannot generate action boundaries and categories straightforwardly. To address the above issues, this paper proposes a end-to-end model, called Adaptive Perception transformer (AdaPerFormer for short). Specifically, AdaPerFormer explores a dual-branch attention mechanism. One branch takes care of the global perception attention, which can model entire video sequences and aggregate global relevant contexts. While the other branch concentrates on the local convolutional shift to aggregate intra-frame and inter-frame information through our bidirectional shift operation. The end-to-end nature produces the boundaries and categories of video actions without extra steps. Extensive experiments together with ablation studies are provided to reveal the effectiveness of our design. Our method obtains competitive performance on the THUMOS14 and ActivityNet-1.3 dataset.

研究の動機と目的

  • アンカーおよび提案ベースの手法が直面するヒューリスティック設計、境界精度の低さ、断片的な文脈モデリングの問題を解消すること。
  • 非微分可能な後処理ステップに依存せずに、行動境界とカテゴリのエンドツーエンド予測を可能にすること。
  • 軽量で効率的なアテンション機構を用いて、アントリムドビデオにおけるグローバルな長距離依存関係とローカルな時間的連続性を同時にモデル化すること。
  • 標準的な自己アテンションが有する高い計算コストと時間的順序の不十分なモデリングを克服するため、二本のアテンションブランチ構造を導入すること。

提案手法

  • 二本のアテンションブランチを備えた二重ブランチ時系列に敏感なアテンション(TAA)機構を提案:一つのブランチは、スパースウィンドウベースの自己アテンションを用いて、動画全体の長距離依存関係をモデル化するグローバルパーセプションアテンションを実装する。
  • 時間的およびチャネル次元に沿った双方向シフト操作を適用する局所的畳み込みシフトブランチを導入し、フレーム内およびフレーム間の局所的文脈を捉える。
  • 二つのTAAブランチの出力を学習可能な重み付け融合により統合し、各層でグローバル表現とローカル表現のバランスを動的に制御可能にする。
  • アンカーおよび提案を一切使用しないシンプルなエンコーダ-デコーダアーキテクチャを採用し、行動境界とカテゴリの直接的なエンドツーエンド予測を実現する。
  • 計算コストを低減しつつグローバルな文脈を保持するため、固定ウィンドウサイズ(例:5, 7)を用いたウィンドウベースのグローバルアテンションを適用する。これにより、密なアテンションの高コストを回避する。
  • 時間的およびチャネル次元で前後方向に特徴を伝搬可能にする双方向シフト操作を導入し、局所的特徴集約を強化する。

実験結果

リサーチクエスチョン

  • RQ1二本のアテンションブランチ機構は、アントリムドビデオにおけるグローバルな長距離依存関係とローカルな時間的連続性を効果的にモデル化できるか?
  • RQ2アンカーまたは提案ベースの設計をエンドツーエンドフレームワークに置き換えることで、検出精度および境界精度が向上するか?
  • RQ3スパースグローバルアテンションと局所的畳み込みシフトの組み合わせは、標準的な自己アテンションに比べて性能および効率性で優れているか?
  • RQ4本研究で提案するTAA機構における最適なウィンドウサイズ、シフトサイズ、アテンション重み設定は何か?

主な発見

  • AdaPerFormerは、THUMOS14データセットで59.3%の平均平均精度(mAP)を達成し、アンカーまたは提案に基づく先行研究を上回った。
  • ActivityNet-1.3データセットでは、mAPが35.1%に達し、既存の手法と同等の性能を示した。
  • アブレーションスタディの結果、二本のブランチ構造が性能向上に顕著に寄与しており、特に局所的畳み込みシフトブランチの寄与度がグローバルパーセプションブランチを上回った。
  • グローバルパーセプションアテンションの最適なウィンドウサイズは5であり、59.3%のmAPを達成した。7や11などの大きなウィンドウサイズは性能をわずかに低下させた。
  • エンコーダおよびデコーダ両方で双方向シフト操作を適用した場合が最良の性能(59.1% mAP)を示し、単方向またはシフトなしの設定を上回った。
  • 二つのTAAブランチに沿ったアテンション重みが合計1になるように学習可能な重みを採用した場合が最良の性能(59.3% mAP)を達成した。固定または対称的な重み設定では精度が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。