Skip to main content
QUICK REVIEW

[論文レビュー] Proposal Relation Network for Temporal Action Detection

Xiang Wang, Zhiwu Qing|arXiv (Cornell University)|Jun 20, 2021
Human Pose and Action Recognition参考文献 20被引用数 16
ひとこと要約

本論文は、自己注意機構を用いてプロポーザル間の関係をモデル化することで、ベースラインのBMNを上回るプロポーザル品質を向上させるためのプロポーザル関係ネットワーク(PRN)を提案する。本手法は、ActivityNet 2021テストセットで44.7%の平均mAPを達成し、2020年の優勝者を1.9%上回った。

ABSTRACT

This technical report presents our solution for temporal action detection task in AcitivityNet Challenge 2021. The purpose of this task is to locate and identify actions of interest in long untrimmed videos. The crucial challenge of the task comes from that the temporal duration of action varies dramatically, and the target actions are typically embedded in a background of irrelevant activities. Our solution builds on BMN, and mainly contains three steps: 1) action classification and feature encoding by Slowfast, CSN and ViViT; 2) proposal generation. We improve BMN by embedding the proposed Proposal Relation Network (PRN), by which we can generate proposals of high quality; 3) action detection. We calculate the detection results by assigning the proposals with corresponding classification results. Finally, we ensemble the results under different settings and achieve 44.7% on the test set, which improves the champion result in ActivityNet 2020 by 1.9% in terms of average mAP.

研究の動機と目的

  • 長時間の未トリム動画におけるアクティビティの継続時間の変動性と背景のごみの影響に取り組むこと。
  • 2段階の時空間アクティビティ検出パイプラインにおけるプロポーザル生成品質の向上。
  • エンドツーエンドで学習可能なモジュールを用いて、プロポーザル間の長距離時系列依存関係をモデル化すること。
  • ViViTのようなTransformerベースのモデルが、検出タスクと分類タスクの両方においてどのように機能するかを評価すること。
  • ActivityNet 2021の時空間アクティビティ検出ベンチマークで最先端のパフォーマンスを達成すること。

提案手法

  • ビデオクリップからの特徴抽出に、Slowfast、CSN、ViViTをバックボーンネットワークとして使用する。
  • 特徴のロバスト性を向上させるために、時系列シフトに基づくデータ拡張モジュールを適用する。
  • 自己注意を用いてプロポーザル間の依存関係をモデル化するプロポーザル関係ネットワーク(PRN)を導入する。
  • 自己注意による非局所演算を用いて、プロポーザル間の長距離時系列的関係を捉える。
  • プロポーザル生成ネットワークからの信頼度マップを用いて、高品質なプロポーザルを生成する。
  • 事前計算された隣接行列や複数段階の訓練を必要とせず、PRNモジュールのエンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1プロポーザル間の関係をモデル化することで、時空間アクティビティ検出におけるプロポーザル品質が向上するか?
  • RQ2自己注意に基づく関係モデリングは、従来の畳み込み型またはGCNベースのアプローチと比較して、プロポーザル生成においてどのように異なるか?
  • RQ3ViViTのようなTransformerベースのモデルが分類タスクでは優れた性能を示すが、なぜ検出タスクではそれほど優れていないのか?
  • RQ4時系列シフトによるデータ拡張は、検出のロバスト性をどの程度向上させるか?
  • RQ5複数のバックボーンとモデルのアンサンブル学習により、長時間の未トリム動画における検出性能がさらに向上するか?

主な発見

  • PRNは、バリデーションセットにおいてAUCをBMNの68.6%から69.3%に向上させ、より優れたプロポーザル品質を示した。
  • PRNはCSN特徴を用いて39.4%の平均mAPを達成し、BMNの38.1%を1.3ポイント上回った。
  • すべてのモデルのアンサンブルは、バリデーションセットで42.0%の平均mAP、テストセットで44.7%の平均mAPを達成し、2020年の優勝者を1.9%上回った。
  • ViViTは分類タスクで91.2%のTop-1精度を達成したが、検出タスクでは37.5%のmAPにとどまり、分類と検出のパフォーマンスのギャップが顕著に現れた。
  • Slowfast152は分類タスクで88.9%を達成し、Slowfast101の87.1%を上回ったが、検出タスクでは38.0%と37.7%でやや劣り、バックボーンの選定が分類よりも検出タスクに大きな影響を与えることが示唆された。
  • 時系列シフトに基づくデータ拡張モジュールは、モデルのロバスト性を向上させ、検出タスクにおける一般化性能の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。