Skip to main content
QUICK REVIEW

[論文レビュー] Proposal-Based Multiple Instance Learning for Weakly-Supervised Temporal Action Localization

Huan Ren, Wenfei Yang|arXiv (Cornell University)|May 29, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文は、弱教師付き時系列行動検出のための、提案ベースの複数インスタンス学習(P-MIL)フレームワークを提案する。この手法は、従来のS-MIL手法におけるセグメントレベルの学習とプロポーザルレベルのテストの間の不一致を解消し、トレーニングおよびインフェンスの両方で直接的に候補プロポーザルを分類する。本手法は、周囲の対照的特徴抽出モジュール、プロポーザル完全性評価モジュール、およびインスタンスレベルの順位一貫性損失を導入し、THUMOS14およびActivityNetで46.5%の平均mAPという最先端の性能を達成した。

ABSTRACT

Weakly-supervised temporal action localization aims to localize and recognize actions in untrimmed videos with only video-level category labels during training. Without instance-level annotations, most existing methods follow the Segment-based Multiple Instance Learning (S-MIL) framework, where the predictions of segments are supervised by the labels of videos. However, the objective for acquiring segment-level scores during training is not consistent with the target for acquiring proposal-level scores during testing, leading to suboptimal results. To deal with this problem, we propose a novel Proposal-based Multiple Instance Learning (P-MIL) framework that directly classifies the candidate proposals in both the training and testing stages, which includes three key designs: 1) a surrounding contrastive feature extraction module to suppress the discriminative short proposals by considering the surrounding contrastive information, 2) a proposal completeness evaluation module to inhibit the low-quality proposals with the guidance of the completeness pseudo labels, and 3) an instance-level rank consistency loss to achieve robust detection by leveraging the complementarity of RGB and FLOW modalities. Extensive experimental results on two challenging benchmarks including THUMOS14 and ActivityNet demonstrate the superior performance of our method.

研究の動機と目的

  • 従来のS-MILフレームワークにおける弱教師付き時系列行動検出のための、トレーニング(セグメントレベルスコアリング)とテスト(プロポーザルレベルスコアリング)の間の不一致を解消すること。
  • 特徴抽出中に周囲の文脈的情報を活用することで、特徴的に顕著な短いプロポーザルへの過学習を抑えること。
  • 完全性の偽ラベルとモダリティの補完性を活用して低品質なプロポーザルを精錬することで、検出のロバストネスを向上させること。
  • 同じ行動インスタンスのプロポーザル間の相対的スコアリングの一貫性を向上させるために、インスタンスレベルの順位一貫性損失を導入すること。
  • パイプライン全体で直接的にプロポーザルを分類することで、トレーニングとテストの目的を統一すること。

提案手法

  • 2段階のトレーニングパイプラインを提案:まずS-MILモデルを事前学習して候補プロポーザルを生成し、その後P-MILモデルを微調整してこれらのプロポーザルを直接分類する。
  • 周囲の対照的特徴抽出(SCFE)モジュールを導入し、プロポーザルの境界を拡張し、外側・内側の対照的特徴を計算することで、過信度の高い短いプロポーザルを抑制する。
  • プロポーザル完全性評価(PCE)モジュールを採用し、高信頼度のプロポーザルを偽インスタンスとして用いてIoUを介して完全性の偽ラベルを生成し、低品質なプロポーザルを抑制する。
  • インスタンスレベルの順位一貫性(IRC)損失を設計し、RGBとFLOWモダリティの補完性を活用して、同じ行動インスタンスのプロポーザルクラスタ内の相対的スコアリングを安定化させる。
  • 分類、完全性、順位一貫性の目的を統合した損失関数を用い、ハイパーパramータ λcomp と λIRC を用いてバランスをとる。
  • 一般化を向上させるために、トレーニング中に追加のバックグラウンドプロポーザルを組み込む。

実験結果

リサーチクエスチョン

  • RQ1直接的にプロポーザルを分類するP-MILフレームワークは、トレーニングとテストの目的を統一し、局所化性能を向上させるか?
  • RQ2周囲の対照的特徴抽出は、特徴的に顕著な短いプロポーザルを抑制し、特徴表現を向上させるのにどの程度有効か?
  • RQ3完全性の偽ラベル付けは、プロポーザルスコアリングの品質と検出精度をどの程度向上させるか?
  • RQ4同じ行動のプロポーザル間でインスタンスレベルの順位一貫性を強制することで、検出のロバストネスとmAPが向上するか?
  • RQ5P-MILモデルはハイパーパramータの設定にどの程度敏感か?また、異なる設定でも安定した性能を維持できるか?

主な発見

  • P-MILフレームワークは、THUMOS14およびActivityNetベンチマークで46.5%の平均mAPを達成し、S-MILベースラインをmAPで2.9%上回った。
  • トレーニング中にバックグラウンドプロポーザルを追加することで、mAPは41.2%から46.5%に向上し、フォアグラウンドとバックグラウンドの分離の向上の効果が示された。
  • 周囲の対照的特徴抽出(SCFE)モジュールを導入することで、ベースラインの特徴抽出に比べてmAPが5.5%向上し、短い顕著なプロポーザルの抑制における有効性が裏付けられた。
  • プロポーザル完全性評価(PCE)モジュールはmAPを0.7%向上させ、インスタンスレベルの順位一貫性(IRC)損失は0.8%向上させ、併用による累積的効果は1.3%であった。
  • ハイパーパramータ λcomp および λirc に対してモデルは低感度であり、さまざまな設定下でもmAP@0.5の変動が2%未満に抑えられ、ロバストネスが確認された。
  • S-MILとP-MILモデルの予測を融合することで、mAPは47.0%にさらに向上し、両手法の相補的な強みが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。