Skip to main content
QUICK REVIEW

[論文レビュー] Two-Stream Consensus Network for Weakly-Supervised Temporal Action Localization

Yuanhao Zhai, Le Wang|arXiv (Cornell University)|Oct 22, 2020
Human Pose and Action Recognition参考文献 47被引用数 14
ひとこと要約

本論文は、弱教師付き時系列行動局所化(W-TAL)のためのTwo-Stream Consensus Network(TSCN)を提案する。この手法は、遅延統合の注目度からフレームレベルの偽正例を繰り返し精錬することで、モデルの監視を強化し、誤検出を低減する。注目度正規化損失を導入し、注目度値を0または1の極端な値に押し上げることで、固定された0.5の閾値による高品質な行動提案を可能にし、THUMOS14およびActivityNetで最先端の性能を達成した。

ABSTRACT

Weakly-supervised Temporal Action Localization (W-TAL) aims to classify and localize all action instances in an untrimmed video under only video-level supervision. However, without frame-level annotations, it is challenging for W-TAL methods to identify false positive action proposals and generate action proposals with precise temporal boundaries. In this paper, we present a Two-Stream Consensus Network (TSCN) to simultaneously address these challenges. The proposed TSCN features an iterative refinement training method, where a frame-level pseudo ground truth is iteratively updated, and used to provide frame-level supervision for improved model training and false positive action proposal elimination. Furthermore, we propose a new attention normalization loss to encourage the predicted attention to act like a binary selection, and promote the precise localization of action instance boundaries. Experiments conducted on the THUMOS14 and ActivityNet datasets show that the proposed TSCN outperforms current state-of-the-art methods, and even achieves comparable results with some recent fully-supervised methods.

研究の動機と目的

  • フレームレベルのアノテーションなしで、弱教師付き時系列行動局所化(W-TAL)における誤検出の多い行動提案の課題に対処すること。
  • 注目度ベースの局所化における固定で経験的に選ばれた閾値に依存しない、行動提案の品質を向上させること。
  • RGBとオプティカルフローの両ストリームの相補的特徴を遅延統合によって活用し、より正確なフレームレベルの偽監視を生成すること。
  • 注目度マップの曖昧さを低減し、正確な境界局所化を可能にするバイナリに近い活性化パターンを促進すること。
  • 訓練時にビデオレベルラベルのみを用いて、完全教師あり手法と同等の性能を達成すること。

提案手法

  • 繰り返し精錬訓練方式により、RGBおよびオプティカルフローの両ストリームの遅延統合注目度出力からフレームレベルの偽正例を生成する。
  • 生成された偽正例を細粒度の監視として用い、両ストリームモデルを再訓練することで、段階的に局所化精度を向上させ、誤検出を低減する。
  • 予測された注目度値を0または1に押し上げる新しい注目度正規化損失を導入し、曖昧さを最小限に抑え、提案の精度を向上させる。
  • 遅延統合により、学習可能な重みを用いてRGBとフローのストリーム注目度マップを統合し、個々のストリームよりもより頑健なコンSENSUS出力を得る。
  • 本手法は、最初にビデオレベルラベルで二ストリームモデルを訓練し、その後、偽ラベルの精錬とモデルの再訓練を繰り返し行う反復ループを実行する。
  • 行動提案は、統合された注目度マップを0.5の閾値で閾値処理することで生成され、正規化された注目度分布のおかげで高品質な結果が得られる。

実験結果

リサーチクエスチョン

  • RQ1遅延統合注目度から得られる偽正例を用いた繰り返し精錬は、弱教師付き時系列行動局所化における局所化精度を向上させることができるか?
  • RQ2注目度正規化損失は、注目度マップの曄態を効果的に低減し、固定閾値(0.5)で高品質な行動提案を可能にするか?
  • RQ3RGBとオプティカルフローのストリームを遅延統合することで、個々のストリームよりも優れたフレームレベルの監視が得られるか?
  • RQ4弱教師あり手法は、完全教師ありベースラインとどの程度同等の性能を達成できるか?
  • RQ5外見と動きのモダリティの相補的特徴は、コンセンサスベースの局所化にどのように寄与するか?

主な発見

  • TSCNモデルは、THUMOS14データセットで偽正例を用いて学習した場合、IoU=0.5のときmAPが45.0%を達成し、ビデオオンリーベースラインの40.9%を顕著に上回った。
  • ActivityNetデータセットでは、偽監視を用いた統合モデルがmAP@IoU=0.5で44.6%に達したのに対し、それなしでは44.4%にとどまり、一貫した改善が確認された。
  • RGBストリームの精度と再現率は、偽監視のおかげで顕著に向上し、それぞれビデオオンリー時(13.2%と8.2%)からフレーム監視時(22.1%と14.4%)に上昇した。
  • フロー・ストリームは偽監視のおかげでF-measureが0.6%向上(32.07から35.73に)、精度と再現率のバランスが改善された。
  • THUMOS14で、偽監視を用いた統合モデルは31.3%の精度と44.6%のmAPを達成し、コンセンサス学習が局所化品質と全体的な性能の両方を向上させることを示した。
  • 定性的な結果から、偽監視により誤検出が低減し、特に近接する行動インスタンスや非標準的なカメラアングルのような困難なケースでも境界の整合性が向上していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。