Skip to main content
QUICK REVIEW

[論文レビュー] SF-Net: Single-Frame Supervision for Temporal Action Localization

Fan Ma, Linchao Zhu|arXiv (Cornell University)|Mar 15, 2020
Human Pose and Action Recognition参考文献 42被引用数 11
ひとこと要約

本論文では、1つの行動インスタンスに対して1フレームのみをアノテートする単一フレーム監視を活用することで、アノテーションコストを大幅に削減しながら、完全監視手法に近い性能を達成する、SF-Netと呼ばれる新しい時間的行動局所化フレームワークを提案する。未ラベルデータから疑似行動フレームおよび疑似バックグラウンドフレームをマイニングし、フレームレベルのアクティビティスコアを予測することで、THUMOS14、GTEA、BEOIDの各データセットにおいて、セグメンテーションおよび単一フレーム局所化の精度が向上し、最先端の弱い監視手法を上回り、完全監視性能に近づいた。

ABSTRACT

In this paper, we study an intermediate form of supervision, i.e., single-frame supervision, for temporal action localization (TAL). To obtain the single-frame supervision, the annotators are asked to identify only a single frame within the temporal window of an action. This can significantly reduce the labor cost of obtaining full supervision which requires annotating the action boundary. Compared to the weak supervision that only annotates the video-level label, the single-frame supervision introduces extra temporal action signals while maintaining low annotation overhead. To make full use of such single-frame supervision, we propose a unified system called SF-Net. First, we propose to predict an actionness score for each video frame. Along with a typical category score, the actionness score can provide comprehensive information about the occurrence of a potential action and aid the temporal boundary refinement during inference. Second, we mine pseudo action and background frames based on the single-frame annotations. We identify pseudo action frames by adaptively expanding each annotated single frame to its nearby, contextual frames and we mine pseudo background frames from all the unannotated frames across multiple videos. Together with the ground-truth labeled frames, these pseudo-labeled frames are further used for training the classifier. In extensive experiments on THUMOS14, GTEA, and BEOID, SF-Net significantly improves upon state-of-the-art weakly-supervised methods in terms of both segment localization and single-frame localization. Notably, SF-Net achieves comparable results to its fully-supervised counterpart which requires much more resource intensive annotations. The code is available at https://github.com/Flowerfan/SF-Net.

研究の動機と目的

  • 完全監視型時間的行動局所化における高いアノテーションコストを低減するとともに、弱い監視手法を上回る性能を向上させること。
  • 1つの行動に対して1フレームのみをアノテートする単一フレーム監視が、正確な境界局所化に十分な時間的信号を提供できるかを検証すること。
  • 限られた単一フレームアノテーションを、疑似ラベル付けとアクティビティスコア予測を通じて効果的に活用する統合フレームワークを開発すること。
  • 1つの行動に対して1つの代表フレームのみを必要とする新しいタスク「単一フレーム局所化」を導入し、評価すること。
  • 最小限だが情報量の多い監視を用いることで、弱い監視と完全監視の間の性能ギャップを埋めること。

提案手法

  • 各動画フレームに対してアクティビティスコアを予測することで、何らかの行動が発生する可能性を示し、時間的境界の微調整を支援する。
  • 複数の動画にわたるすべての未アノテートフレームから、新規のバックグラウンドマイニングアルゴリズムを用いて疑似バックグラウンドフレームを抽出する。
  • 時間的に隣接する、高い信頼度を持つ文脈フレームを動的に含めることで、アノテート済みの単一フレームを疑似行動フレームに拡張する。
  • 正例フレーム、マイニングされた疑似行動フレーム、およびマイニングされた疑似バックグラウンドフレームの組み合わせを用いて分類器を訓練する。
  • 推論時に回帰ヘッドを用いずに、アクティビティスコア系列にしきい値戦略を適用することで、行動境界を予測する。
  • 局所化精度の向上を図るため、統合ネットワークアーキテクチャ内でカテゴリスコアとアクティビティスコアを統合する。

実験結果

リサーチクエスチョン

  • RQ11つの行動インスタンスに対して1フレームのみをアノテートする単一フレーム監視は、アノテーションコストを大幅に削減しながらも、高い局所化精度を維持できるか?
  • RQ2疎な単一フレームアノテーションしか利用できない状況で、行動フレームおよびバックグラウンドフレームの疑似ラベル付けを効果的に活用することで、モデルの一般化性能を向上させられるか?
  • RQ3フレームレベルのアクティビティスコアを予測することで、行動とバックグラウンドを区別し、時間的境界を微調整できるか?
  • RQ4SF-Netは、著しく少ないアノテーション作業で、完全監視手法と同等の性能を達成できるか?
  • RQ5多様なデータセットにおいて、単一フレーム監視は弱い監視と比較して、局所化性能で優れているか?

主な発見

  • THUMOS14データセットでは、人間がアノテートした単一フレームで学習したSF-Netは、IoU=0.5の条件下でmAP 51.5を達成し、すべての先行する弱い監視手法を上回った。
  • 正例アノテーションから単一フレームラベルを模擬的に生成した場合、SF-NetはmAP 51.2を達成し、最小限の監視で優れた性能を示した。
  • BEOIDおよびGTEAでは、SF-Netは弱い監視ベースラインを顕著に上回り、特に1動画に複数の行動クラスが存在するデータセットで最大の向上が見られた。
  • アクティビティスコアモジュールおよび疑似バックグラウンドマイニング戦略は、THUMOS14およびBEOIDで性能向上をもたらしたが、GTEAではバックグラウンドフレームの不足のため、限定的な効果にとどまった。
  • SF-Netは、はるかに少ないアノテーション作業を要する一方で、BMN や P-GCN といった完全監視モデルと同等の結果を達成した。
  • 人間がアノテートした単一フレームで学習したモデルは、行動セグメントから均等にサンプリングされたフレームで学習したモデルを上回った。これは、人間がアノテートした時間的ヒントの価値を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。