Skip to main content
QUICK REVIEW

[論文レビュー] ASM-Loc: Action-aware Segment Modeling for Weakly-Supervised Temporal Action Localization

Bo He, Xitong Yang|arXiv (Cornell University)|Mar 29, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

ASM-Locは、標準的なMILベースの手法の限界を克服するための、アクションに特化したセグメントモデリングを導入した、弱教師付き時空間行動局所化フレームワークを提案する。動的セグメントサンプリング、イントラセグメントおよびインタラセグメントアテンション、疑似インスタンスレベルの監督、マルチステップの最適化を組み合わせることで、THUMOS-14およびActivityNet-v1.3で最先端の性能を達成し、それぞれ4.8%および2.4%のmAP向上を達成した。

ABSTRACT

Weakly-supervised temporal action localization aims to recognize and localize action segments in untrimmed videos given only video-level action labels for training. Without the boundary information of action segments, existing methods mostly rely on multiple instance learning (MIL), where the predictions of unlabeled instances (i.e., video snippets) are supervised by classifying labeled bags (i.e., untrimmed videos). However, this formulation typically treats snippets in a video as independent instances, ignoring the underlying temporal structures within and across action segments. To address this problem, we propose \system, a novel WTAL framework that enables explicit, action-aware segment modeling beyond standard MIL-based methods. Our framework entails three segment-centric components: (i) dynamic segment sampling for compensating the contribution of short actions; (ii) intra- and inter-segment attention for modeling action dynamics and capturing temporal dependencies; (iii) pseudo instance-level supervision for improving action boundary prediction. Furthermore, a multi-step refinement strategy is proposed to progressively improve action proposals along the model training process. Extensive experiments on THUMOS-14 and ActivityNet-v1.3 demonstrate the effectiveness of our approach, establishing new state of the art on both datasets. The code and models are publicly available at~\url{https://github.com/boheumd/ASM-Loc}.

研究の動機と目的

  • 標準的なMILベースのフレームワークを超えた時系列構造をモデル化することで、弱教師付きと完全教師付きの時空間行動局所化の性能ギャップを解消する。
  • 短いアクションの検出漏れや、局所化の不完全または過剰な問題といった、MILベース手法の一般的な失敗要因を克服する。
  • セグメント中心のコンponentsを導入することで、アクションセグメント内およびセグメント間の時系列依存性を活用し、境界予測と局所化の完全性を向上させる。
  • 疑似インスタンスレベルの監督における不確実性推定を活用することで、ノイズの多いラベルに対する耐性を高める。
  • マルチステップのトレーニング戦略を用いて段階的にアクション候補を最適化することで、局所化の正確性を向上させる。

提案手法

  • セグメント中心のモデリングの基盤として、標準的なMILベースの手法を用いて初期のアクション候補を生成する。
  • 提案された持続時間に基づいて動的に計算されるスケールアップ比に従い、短いアクション候補をアップサンプリングする動的セグメントサンプリングを実装する。これにより、短いアクションと長いアクションの寄与がバランスされる。
  • 各アクション候補内で自己アテンションを適用し、アクションのダイナミクスをモデル化するとともに、背景ノイズを抑制するイントラセグメントアテンションモジュールを導入する。
  • 異なるアクション候補間で自己アテンションを適用し、アクション間の時系列依存性(例:"CricketsBowling" の次に "CricketsShotting")を捉えるインタラセグメントアテンションモジュールを提案する。
  • 不確実性推定を組み込んだ疑似インスタンスレベルの損失を適用し、境界予測を精緻化し、ノイズの多い疑似ラベルの影響を低減する。
  • 複数のトレーニング段階を経て段階的にアクション候補を改善するマルチステップの最適化戦略を採用し、逐次的に局所化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1明示的なセグメントベースのモデリングは、標準的なMILベースのフレームワークを超えて、弱教師付き時空間行動局所化を改善できるか?
  • RQ2アクションセグメント内およびセグメント間の時系列構造をモデル化することで、局所化の正確性と境界予測にどのような影響を与えるか?
  • RQ3短いアクションセグメントの動的サンプリングは、短時間のアクション検出性能にどの程度向上効果をもたらすか?
  • RQ4疑似インスタンスレベルの監督における不確実性推定は、ラベルノイズの影響を軽減するためにどの程度有効か?
  • RQ5アクション候補のマルチステップの最適化は、弱教師付きTALにおいて一貫した性能向上をもたらすか?

主な発見

  • THUMOS-14では45.1%のmAPを達成し、ベースライン比で4.8%の向上を示し、新たな最先端性能を樹立した。
  • ActivityNet-v1.3でも45.1%のmAPを達成し、前回のSOTA比で2.4%の向上を示し、複数のデータセットにわたる一貫した性能向上を示した。
  • 動的セグメントサンプリングモジュールにより、超短時間(XS)セグメントで+4.9%、短時間(S)セグメントで+1.2%の局所化性能向上が達成された。
  • イントラセグメントアテンションモジュールは、グローバルアテンションや背景のみのアテンション設定を大きく上回り、セグメント中心の自己アテンションの必要性を実証した。
  • 疑似インスタンスレベルの監督における不確実性推定により、平均mAPが1%向上し、ノイズの影響低減の有効性が示された。
  • マルチステップの最適化により、ステップ数が増えるほど性能が向上し、3ステップで性能の飽和が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。