Skip to main content
QUICK REVIEW

[論文レビュー] Low-Fidelity End-to-End Video Encoder Pre-training for Temporal Action Localization

Mengmeng Xu, Juan-Manuel Pérez-Rúa|arXiv (Cornell University)|Mar 28, 2021
Human Pose and Action Recognition参考文献 66被引用数 4
ひとこと要約

本論文は、GPUメモリ制約下でエンドツーエンド学習を可能にする低精細度(LoFi)動画エンコーダ最適化手法を提案する。微小バッチの時間的・空間的次元における解像度を事前学習段階で低くすることで、TAL(時間的行動局所化)の監視信号を通じて勾配がエンコーダへ戻るのを可能にし、特徴表現を著しく向上させ、単一ストリームのResNet18でさえ二ストリームのResNet50モデルを上回る新たなSOTA性能を達成する。

ABSTRACT

Temporal action localization (TAL) is a fundamental yet challenging task in video understanding. Existing TAL methods rely on pre-training a video encoder through action classification supervision. This results in a task discrepancy problem for the video encoder -- trained for action classification, but used for TAL. Intuitively, end-to-end model optimization is a good solution. However, this is not operable for TAL subject to the GPU memory constraints, due to the prohibitive computational cost in processing long untrimmed videos. In this paper, we resolve this challenge by introducing a novel low-fidelity end-to-end (LoFi) video encoder pre-training method. Instead of always using the full training configurations for TAL learning, we propose to reduce the mini-batch composition in terms of temporal, spatial or spatio-temporal resolution so that end-to-end optimization for the video encoder becomes operable under the memory conditions of a mid-range hardware budget. Crucially, this enables the gradient to flow backward through the video encoder from a TAL loss supervision, favourably solving the task discrepancy problem and providing more effective feature representations. Extensive experiments show that the proposed LoFi pre-training approach can significantly enhance the performance of existing TAL methods. Encouragingly, even with a lightweight ResNet18 based video encoder in a single RGB stream, our method surpasses two-stream ResNet50 based alternatives with expensive optical flow, often by a good margin.

研究の動機と目的

  • 既存のTAL手法におけるタスク不一致問題に対処すること。具体的には、行動分類のための事前学習が行われた動画エンコーダが、時間的局所化タスクに使用されている点。
  • 長時間のトリムドでない動画によるGPUメモリ制限の下でも、動画エンコーダとTALヘッドの共同最適化を可能にすること。
  • TALの監視信号に条件付けられた学習により特徴表現を向上させる、記憶効率の高い手法を開発すること。
  • LoFi最適化が異なるバックボーンアーキテクチャおよびデータセットにおいて一貫して性能向上をもたらすことを示すこと。
  • LoFiが標準的事前学習および自己教師付き学習手法よりもTALで優れていることを示すこと。

提案手法

  • GPUメモリ使用量を削減するため、時間的・空間的、または空間時間的次元におけるミニバッチ解像度を低くする低精細度(LoFi)トレーニング段階を導入する。
  • このLoFi段階でTAL監視損失を用いて、動画エンコーダおよびTALヘッドのエンドツーエンド最適化を実行する。
  • 標準的トレーニングと同一のハードウェア予算を維持することで、中程度のGPUでも実用的であることを保証する。
  • LoFi最適化済みエンコーダを、標準の行動分類事前学習に代わる、下流のTALタスクのバックボーンとして使用する。
  • トレーニングの安定性と勾配の流れを維持するため、長周期の低精細度構成を適用する。
  • ActivityNet-v1.3およびHACSベンチマークで、さまざまな動画エンコーダ(ResNet18, 34, 50)およびTALヘッド(G-TAD, BC-GNN)を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1GPUメモリ制約下でも、動画エンコーダとTALヘッドのエンドツーエンド最適化が性能向上に寄与するか?
  • RQ2LoFiトレーニングは、行動分類と時間的行動局所化の間のタスク不一致を軽減するか?
  • RQ3適切なLoFi事前学習を施した軽量の単一ストリームRGBエンコーダが、二ストリームのResNet50モデルを上回る性能を発揮できるか?
  • RQ4LoFiは自己教師付き学習および標準的行動分類事前学習と比較して、TALでどのように優れているか?
  • RQ5LoFiによる性能向上は、異なる動画エンコーダの深さおよびアーキテクチャに一般化されるか?

主な発見

  • LoFi手法は、TSM-R18を用いてActivityNet-v1.3で平均mAP 34.49の新たなSOTAを達成し、標準のACPベースラインを+0.90 mAP上回った。
  • 単一RGBストリームおよびResNet18でさえ、LoFiにより二ストリームのResNet50モデルを上回る性能を示し、タスク特化型エンコーダ最適化の有効性を裏付けた。
  • より深いバックボーンに対しても性能向上は一貫しており、ActivityNet-v1.3においてTSM-R34では+0.84 mAP、TSM-R50では+0.70 mAPの向上を達成した。
  • LoFi事前学習はArrow of TimeおよびSpeedNetの自己教師付き学習手法を上回り、標準的事前学習と組み合わせた場合でも僅かな向上に留まる。
  • ACPと自己教師付き学習を組み合わせた場合、わずかな改善(例:+0.16 mAP)に留まり、相乗効果が限定的であることが示された。
  • LoFi手法は、LoFiトレーニング段階で1動画あたり1回の順伝播のみで優れた性能を達成しており、計算的にも効率的で実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。