Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Pre-training for Temporal Action Localization Tasks

Can Zhang, Tianyu Yang|arXiv (Cornell University)|Mar 25, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文は、時間的行動定位(TAL)に特化した動画特徴エンコーダーの教師なし事前学習のための、自己教師付きプロムプトタスクである疑似行動局在(PAL)を提案する。時間的領域をランダムにクロップして疑似行動とし、それらを異なる背景動画に貼り付けることで、対照的学習を用いて時間的等長性を強制する。これにより、従来の教師ありおよび教師なし事前学習手法と比較して、下流のTAL性能が顕著に向上する。

ABSTRACT

Unsupervised video representation learning has made remarkable achievements in recent years. However, most existing methods are designed and optimized for video classification. These pre-trained models can be sub-optimal for temporal localization tasks due to the inherent discrepancy between video-level classification and clip-level localization. To bridge this gap, we make the first attempt to propose a self-supervised pretext task, coined as Pseudo Action Localization (PAL) to Unsupervisedly Pre-train feature encoders for Temporal Action Localization tasks (UP-TAL). Specifically, we first randomly select temporal regions, each of which contains multiple clips, from one video as pseudo actions and then paste them onto different temporal positions of the other two videos. The pretext task is to align the features of pasted pseudo action regions from two synthetic videos and maximize the agreement between them. Compared to the existing unsupervised video representation learning approaches, our PAL adapts better to downstream TAL tasks by introducing a temporal equivariant contrastive learning paradigm in a temporally dense and scale-aware manner. Extensive experiments show that PAL can utilize large-scale unlabeled video data to significantly boost the performance of existing TAL methods. Our codes and models will be made publicly available at https://github.com/zhang-can/UP-TAL.

研究の動機と目的

  • 時間的行動局在(TAL)の要件に適合した事前学習手法を設計することで、動画分類(TAC)とTALの間の性能ギャップを是正すること。
  • 従来の教師なし動画表現学習が動画レベルのインスタンス識別に焦点を当てており、局在に必要な時間的等長性を捉えられていないという制限を克服すること。
  • 実際のTALタスクに内在する時間的境界検出およびスケール/速度の変動を模倣するプロムプトタスクを導入することで、大規模なラベルなし動画データをTALに効果的に活用できること。
  • 背景の干渉を最小限に抑えながら、特徴の識別性の高い行動部分に注目することで、特徴のロバスト性と境界認識能力を向上させる事前学習パラダイムを開発すること。

提案手法

  • 時間的長さとスケールを変動させる複数の連続的なクリップを動画からランダムにクロップして、疑似行動領域を構築する。
  • これらの疑似行動を、別の2つの背景動画の異なる時間的位置に貼り付けて、合成された学習ペアを生成する。
  • 同じ疑似行動の特徴が2つの合成動画間で一致するように、時間的等長性を保証する対照的学習目的関数を適用する。
  • クリップレベル特徴を処理するためのマルチレイヤー時間的畳み込みネットワークを用い、文脈認識を高め、局在に適した特徴表現を可能にする。
  • 2つの合成動画における貼り付けられた疑似行動領域の特徴の一致を最大化することで、背景に依存しない識別性の高い行動成分に注目するよう促進する。
  • 時間的平行移動およびスケール等長性を促進するようにプロムプトタスクを設計し、行動の開始時刻や継続時間の変化に特徴が適応できるようにする。

実験結果

リサーチクエスチョン

  • RQ1動画レベル分類を越えて、時間的行動局在(TAL)の要件に適合した事前学習表現を設計するための自己教師付きプロムプトタスクは可能か?
  • RQ2標準的なインスタンス識別と比較して、対照的学習フレームワークを用いて時間的等長性を強制することで、局在タスクの特徴品質が向上するか?
  • RQ3提案された疑似行動局在(PAL)プロムプトタスクは、ActivityNet や THUMOS といった下流のTALベンチマークで微調整された際に、どのように性能を発揮するか?
  • RQ4PALは小規模データセットにも一般化し、他の動画理解タスク(例:行動分類)への転移はどの程度可能か?
  • RQ5学習された特徴は、時間的変換が加えられた場合に特徴空間に反映されるような時間的等長性を示すか?

主な発見

  • ActivityNet v1.3では、PALはMoCo-v2と比較してmAP@AVGを2.2%向上し、TACで事前学習されたベースラインと比較して1.2%向上した。
  • 小規模なTHUMOS’14データセットでは、PALはmAP@0.7で相対的に10.9%の性能向上を達成し、低データ環境下での優れた一般化性能を示した。
  • UCF101とHMDB51の行動分類タスクにおいて、SOTAのMoCo-v2ベースラインをそれぞれ+2.7%および+3.1%上回るトップ1正答率を達成した。
  • 特徴可視化の結果、PALは時間的等長性を持つ特徴を学習していることが確認された:時間的変換下でも行動クリップ間の類似度が予測可能に変化するが、時間不変なベースラインとは対照的である。
  • 境界認識能力が向上し、行動クリップと背景クリップとの間の対比が強化され、より鋭く情報量の多い特徴表現が得られた。
  • 提案手法はTALを越えて一般化し、行動分類タスクでも競争力のある性能を示しており、学習された表現の広範な転移可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。