Skip to main content
QUICK REVIEW

[論文レビュー] Towards Train-Test Consistency for Semi-supervised Temporal Action Localization

Xudong Lin, Zheng Shou|arXiv (Cornell University)|Oct 24, 2019
Human Pose and Action Recognition参考文献 64被引用数 4
ひとこと要約

本稿では、弱教師あり時刻行動局所化におけるトレーニングとテストの不一致を解消するための、トレーニング時および推論時において適応的閾値を予測する、トレーニング・テスト一貫性のあるフレームワークTTC-Locを提案する。トレーニング時に時刻境界のアノテーションから明示的な監督を受けることで、TTC-Locは、1クラスあたり1本の完全アノテーション付き動画のみを用いても、THUMOS'14で33.4% mAP(IoU=0.5)を達成し、最先端の性能を実現する。

ABSTRACT

Recently, Weakly-supervised Temporal Action Localization (WTAL) has been densely studied but there is still a large gap between weakly-supervised models and fully-supervised models. It is practical and intuitive to annotate temporal boundaries of a few examples and utilize them to help WTAL models better detect actions. However, the train-test discrepancy of action localization strategy prevents WTAL models from leveraging semi-supervision for further improvement. At training time, attention or multiple instance learning is used to aggregate predictions of each snippet for video-level classification; at test time, they first obtain action score sequences over time, then truncate segments of scores higher than a fixed threshold, and post-process action segments. The inconsistent strategy makes it hard to explicitly supervise the action localization model with temporal boundary annotations at training time. In this paper, we propose a Train-Test Consistent framework, TTC-Loc. In both training and testing time, our TTC-Loc localizes actions by comparing scores of action classes and predicted threshold, which enables it to be trained with semi-supervision. By fixing the train-test discrepancy, our TTC-Loc significantly outperforms the state-of-the-art performance on THUMOS'14, ActivityNet 1.2 and 1.3 when only video-level labels are provided for training. With full annotations of only one video per class and video-level labels for the other videos, our TTC-Loc further boosts the performance and achieves 33.4\% mAP (IoU threshold 0.5) on THUMOS's 14.

研究の動機と目的

  • 限られた完全アノテーションを活用して、弱教師ありと完全教師ありの時刻行動局所化の間の大きな性能差を是正すること。
  • 従来のWTAL手法におけるトレーニング時とテスト時の局所化戦略の不一致(トレーニング時:注目/MIL集約、テスト時:固定閾値分割)を特定および解決すること。
  • トレーニング時に時刻境界アノテーションを用いて、トレーニングと推論の挙動を一致させることで、行動局所化モデルに対する明示的監督を可能にすること。
  • 動画レベルのラベルと疎な完全アノテーションを組み合わせた、半教師あり時刻行動局所化(STAL)設定を提案し、モデルの一般化性能を向上させること。
  • 弱教師ありおよび半教師ありの両設定下で、ベンチマークデータセットにおいて最先端の性能を達成すること。

提案手法

  • トレーニング時および推論時において、行動セグメント検出に予測された閾値を使用するトレーニング・テスト一貫性のある局所化戦略を導入し、固定された手動閾値に代わる。
  • シグモイド関数を用いた微分可能なゲーティング機構を設計し、動画レベル特徴から適応的閾値を生成することで、エンド・トゥ・エンドのトレーニングを可能にする。
  • 内積を用いて行動スコアとバックグラウンドスコアのマージンを最大化する正則化損失 $L_{\text{reg}}$ を定式化し、頑健な行動プロポーザル生成を促進する。
  • 一部の動画の時刻境界アノテーションを直接使用してモデルを監督する局所化損失 $L_{\text{loc}}$ を統合し、半教師あり学習を可能にする。
  • 動画レベルラベルと部分的な完全アノテーションの両方を統合してトレーニングし、事前学習と微調整よりも優れた性能を示すデフォルト戦略を採用する。
  • 分類損失 $L_{\text{clas}}$、正則化損失 $L_{\text{reg}}$、局所化損失 $L_{\text{loc}}$ を統合した統一損失関数を用いて、エンド・トゥ・エンド最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1行動局所化におけるトレーニング・テスト不一致を解消することで、弱教師あり設定下でのモデル性能が向上するか?
  • RQ2トレーニング時に適応的閾値を予測することは、時刻境界アノテーションを効果的に活用する能力にどのように影響するか?
  • RQ3半教師あり時刻行動局所化において、動画レベルラベルと疎な完全アノテーションを組み合わせる最適なトレーニング戦略は何か?
  • RQ4ゲーティング関数および正則化定式化の選択が、局所化性能に顕著な影響を及えるか?
  • RQ5一貫性のあるトレーニング・テスト戦略により、最小限の完全アノテーションで完全教師あり性能に近い半教師ありモデルを実現できるか?

主な発見

  • TTC-Locは、1クラスあたり1本の完全アノテーション付き動画を用いる半教師あり設定下で、THUMOS'14で32.0% mAPを達成し、先行研究の最先端手法を著しく上回る。
  • 1クラスあたり1本の完全アノテーション付き動画に加え、残りの動画に動画レベルラベルを適用した状況でも、TTC-LocはTHUMOS'14でIoU=0.5の条件下で33.4% mAPを達成し、極めて少ない監視下でも優れた一般化性能を示す。
  • 完全監視と弱い監視の両方を統合したジョイントトレーニング戦略は、事前学習と微調整を上回り、32.0% mAPを達成した(対照的に、後者は28.4% mAP)。
  • シグモイドゲーティング関数は、バイナリゼーション(13.5% mAP)やソフトシグノイド(27.4% mAP)よりも優れた性能(28.2% mAP)を示し、最適化の安定性に優れている。
  • 内積による $L_{\text{reg}}$ の定式化が最良の性能(28.2% mAP)を達成し、L1、L2、コサイン類似度よりも強いマージン強制により優位性を示した。
  • $L_{\text{reg}}$ と $L_{\text{loc}}$ を追加することで局所化精度が著しく向上し、$L_{\text{reg}}$ のみを用いても、mAPが18.4%から28.2%に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。