Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Temporal Action Localization via Representative Snippet Knowledge Propagation

Linjiang Huang, Liang Wang|arXiv (Cornell University)|Mar 6, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文は、動画内および動画間の代表的ビデオスニペットから知識を伝達することで、偽ラベルの品質を向上させる弱教師付き時系列行動局所化手法を提案する。メモリバンクと双方向ランダムウォーク(BiRW)モジュールを用いて特徴表現を精緻化し、より正確な時系列クラス活性化マップ(TCAM)を生成することで、THUMOS14で1.2%のmAP向上を達成し、最先端性能を実現した。複数のベースラインで一貫した改善効果を示した。

ABSTRACT

Weakly supervised temporal action localization aims to localize temporal boundaries of actions and simultaneously identify their categories with only video-level category labels. Many existing methods seek to generate pseudo labels for bridging the discrepancy between classification and localization, but usually only make use of limited contextual information for pseudo label generation. To alleviate this problem, we propose a representative snippet summarization and propagation framework. Our method seeks to mine the representative snippets in each video for propagating information between video snippets to generate better pseudo labels. For each video, its own representative snippets and the representative snippets from a memory bank are propagated to update the input features in an intra- and inter-video manner. The pseudo labels are generated from the temporal class activation maps of the updated features to rectify the predictions of the main branch. Our method obtains superior performance in comparison to the existing methods on two benchmarks, THUMOS14 and ActivityNet1.3, achieving gains as high as 1.2% in terms of average mAP on THUMOS14.

研究の動機と目的

  • 弱教師付き時系列行動局所化における動画レベル分類とスニペットレベル局所化の乖離を是正すること。
  • 個々のスニペットを超えた文脈的情報を活用して偽ラベル品質を向上させること。
  • 代表的スニペットを知識のキャリアとして用いて、動画内および動画間の知識伝達を可能にすること。
  • 局所化を誤導する分類的または背景スニペットへの依存度を低減すること。
  • 動画レベルラベルのみを用いる最小限の監視で、最先端性能を達成すること。

提案手法

  • 視点、行動、背景の変動に耐性を持つように、期待最大化注意機構を用いて各動画の代表的スニペットを特定する。
  • すべての動画からの高信頼度の代表的スニペットを格納するメモリバンクを維持し、動画間知識伝達を実現する。
  • 双方向ランダムウォーク(BiRW)モジュールを用いて、動画内および動画間の代表的スニペットからの知識伝達により、動画特徴を更新する。
  • 更新された特徴を用いて、主モデルの予測を是正するためのオンライン偽ラベルとして、精緻化された時系列クラス活性化マップ(TCAM)を生成する。
  • 二重ブランチ学習方式を統合:主ブランチは動画レベルラベルから学習し、補助ブランチは偽ラベルから学習することで、代表的スニペットへの注目を強化する。
  • 反復的伝播における特徴更新の安定化を図るため、残差接続を適用し、勾配消失を防止する。

実験結果

リサーチクエスチョン

  • RQ1動画内の代表的スニペットとメモリバンクを用いることで、弱教師付き時系列行動局所化における偽ラベル品質が向上するか?
  • RQ2代表的スニペットからの動画内および動画間知識伝達が、局所化精度にどのように影響するか?
  • RQ3スコアではなく特徴を伝播させることで、弱教師付き設定でより良い性能が得られるか?
  • RQ4提案フレームワークは、最小限のアーキテクチャ変更で、既存の最先端手法を一貫して改善できるか?
  • RQ5性能と学習安定性のバランスを考慮した場合、最適な伝播イタレーション数は何か?

主な発見

  • 提案手法は、先行手法と比較してTHUMOS14で1.2%のmAP絶対的向上を達成し、最先端性能を実証した。
  • ActivityNet1.3でも優れた性能を達成し、データセット間での汎用性を確認した。
  • 除去実験では、残差接続を備えた重み付き特徴伝播が、直接伝播やスコアベース伝播を上回ることを示した。
  • STPN、BM、WUM、FAC-Netを含む複数のベースラインで一貫した性能向上を示し、mAP向上最大4.8%を達成した。
  • 最適な伝播イタレーション数は5であり、それ以上のイタレーションでは勾配不安定性により性能が劣化した。
  • メモリバンク機構により、GPUメモリコストを低く抑えながらも、効果的な動画間知識伝達を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。