Skip to main content
QUICK REVIEW

[論文レビュー] Bottom-Up Temporal Action Localization with Mutual Regularization

Peisen Zhao, Lingxi Xie|arXiv (Cornell University)|Feb 18, 2020
Human Pose and Action Recognition参考文献 41被引用数 8
ひとこと要約

本稿では、自己正則化を用いてフレームレベルのアクションフェーズ予測を向上させるボトムアップ型時系列行動局所化フレームワークを提案する。各フェーズ内での時間的滑らかさと、開始・継続・終了フェーズ間の順序付けられた一貫性を強制するため、Intra-phase Consistency (IntraC) および Inter-phase Consistency (InterC) の損失関数を導入した。この手法は、THUMOS14でIoU=0.7の条件下でmAPを6.8%絶対的に向上させ、さまざまなTALアーキテクチャに一般化可能である。

ABSTRACT

Recently, temporal action localization (TAL), i.e., finding specific action segments in untrimmed videos, has attracted increasing attentions of the computer vision community. State-of-the-art solutions for TAL involves evaluating the frame-level probabilities of three action-indicating phases, i.e. starting, continuing, and ending; and then post-processing these predictions for the final localization. This paper delves deep into this mechanism, and argues that existing methods, by modeling these phases as individual classification tasks, ignored the potential temporal constraints between them. This can lead to incorrect and/or inconsistent predictions when some frames of the video input lack sufficient discriminative information. To alleviate this problem, we introduce two regularization terms to mutually regularize the learning procedure: the Intra-phase Consistency (IntraC) regularization is proposed to make the predictions verified inside each phase; and the Inter-phase Consistency (InterC) regularization is proposed to keep consistency between these phases. Jointly optimizing these two terms, the entire framework is aware of these potential constraints during an end-to-end optimization process. Experiments are performed on two popular TAL datasets, THUMOS14 and ActivityNet1.3. Our approach clearly outperforms the baseline both quantitatively and qualitatively. The proposed regularization also generalizes to other TAL methods (e.g., TSA-Net and PGCN). code: https://github.com/PeisenZhao/Bottom-Up-TAL-with-MR

研究の動機と目的

  • 開始・継続・終了フェーズを個別にモデル化することで生じる、フレームレベルの予測の不一致および不連続性を解消すること。
  • 標準的な二値分類設定では無視される、フレーム間の時間的依存性およびフェーズの順序制約を活用すること。
  • エンドツーエンド微分可能な正則化を用いて予測の自己一貫性を強制することで、局所化精度を向上させること。
  • 提案された正則化がベースモデルを超えて一般化可能であることを示すこと、他の最先端TALフレームワークでも性能向上を達成すること。

提案手法

  • 各フェーズ(開始・継続・終了)の正例領域および負例領域内で滑らかさを強制するため、Intra-phase Consistency (IntraC) 正則化を導入し、領域内差異を最小化する。
  • 継続・開始および継続・終了確率の間の結合を用いて、アクションフェーズの論理的順序を強制するため、Inter-phase Consistency (InterC) 正則化を提案する。
  • 3つのフェーズ分類器を一貫性チェックで結合することで、勾配伝搬を損なわず、相互正則化を実現する。
  • 標準的な交差エントロピー損失に加え、IntraCおよびInterC項を組み合わせた微分可能な損失関数を用い、時間的事前知識を組み込んだフェーズ予測の共同最適化を可能にする。
  • フレームレベルの確率マップに正則化を適用し、予測の安定化と曖昧領域における誤検出の抑制を実現する。
  • THUMOS14およびActivityNet1.3で手法を検証し、複数のベースラインおよびアーキテクチャで一貫した性能向上を示した。

実験結果

リサーチクエスチョン

  • RQ1各アクションフェーズ内での時間的滑らかさを強制することで、ボトムアップ型TALにおけるフレームレベルの予測の一貫性および局所化精度が向上するか?
  • RQ2開始・継続・終了フェーズ間の順序関係をモデル化することで、矛盾する予測が減少し、局所化品質が向上するか?
  • RQ3提案された相互正則化は、ベースモデルを超えて他のTALフレームワークへも効果的に転送可能か?
  • RQ4特に厳密なIoU閾値(例:IoU=0.7)下で、正則化が性能向上にどの程度寄与するか?
  • RQ5弱教師ありまたは無教師設定において、提案された一貫性損失は、代替的な平滑化または正則化戦略よりも優れているか?

主な発見

  • 提案手法は、THUMOS14データセットにおいて、以前の最先端手法に比べてIoU=0.7の条件下でmAPが6.8%絶対的に向上した。
  • ActivityNet1.3では、ベースラインに比べてIoU=0.3でmAPが2.1%向上、IoU=0.5で1.8%向上した。
  • IntraCおよびInterC正則化は予測を著しく安定化させ、開始および終了フェーズマップにおける誤検出を低減した。
  • 定性的な結果から、正則化により不自然な提案(例:「CleanAndJerk」と「Wakeboarding」の間の誤った開始点)が抑制されていることが示された。
  • 相互正則化は良好に一般化可能である:TSA-NetおよびPGCNに適用した場合、両モデルとも性能向上を達成し、本手法の転送可能性を確認した。
  • オラクル解析から、提案順序付けが主なボトルネックであることが判明し、本手法は予測の一貫性を向上させることで、そのギャップの大部分を埋めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。