[論文レビュー] Few-Shot Temporal Action Localization with Query Adaptive Transformer
本論文は、背景文脈を保持する非トリムドサポート動画を用いて、文脈理解とモデル一般化性能を向上させる、新しい少ショット時系列行動検出(FS-TAL)設定を提案する。クエリ適応型トランスフォーマー(QAT)を導入し、各クエリ動画に応じてベース分類器を動的に適応させる。これにより、ActivityNetおよびTHUMOSの両方の1/5ショット設定において、単一ドメインおよびクロスドメインのシナリオで、先行研究を4.8–6.2 mAP@0.5の差で上回る。
Existing temporal action localization (TAL) works rely on a large number of training videos with exhaustive segment-level annotation, preventing them from scaling to new classes. As a solution to this problem, few-shot TAL (FS-TAL) aims to adapt a model to a new class represented by as few as a single video. Exiting FS-TAL methods assume trimmed training videos for new classes. However, this setting is not only unnatural actions are typically captured in untrimmed videos, but also ignores background video segments containing vital contextual cues for foreground action segmentation. In this work, we first propose a new FS-TAL setting by proposing to use untrimmed training videos. Further, a novel FS-TAL model is proposed which maximizes the knowledge transfer from training classes whilst enabling the model to be dynamically adapted to both the new class and each video of that class simultaneously. This is achieved by introducing a query adaptive Transformer in the model. Extensive experiments on two action localization benchmarks demonstrate that our method can outperform all the state of the art alternatives significantly in both single-domain and cross-domain scenarios. The source code can be found in https://github.com/sauradip/fewshotQAT
研究の動機と目的
- 既存の少ショットTAL手法がトリムド動画に依存するという制限を解決する。これは、貴重な背景文脈を無視するためである。
- 新しいクラスが時間的アノテーション付きの非トリムド動画で表される、より実用的なFS-TAL設定を提案する。
- 新規クラスおよび個々のクエリ動画に応じて、前景/背景分類器を動的に適応可能にする。
- 非トリムド動画内の文脈的手がかりを活用することで、既知のクラスから未知のクラスへの知識転送を向上させる。
- 低ショット状況下でのクラス内不変性モデリングを強化するクエリ適応型トランスフォーマー機構を開発する。
提案手法
- サポートセットが完全な時間的アノテーションを持つ非トリムド動画から構成される、新しいFS-TAL設定を提案する。これにより背景文脈が保持される。
- クエリ動画特徴量と分類器重みを入力として受け取り、動画固有の分類器適応を生成するクエリ適応型トランスフォーマー(QAT)を設計する。
- サポートセット上で学習されたスニペットレベルのバイナリ分類器を用い、前景スニペットと背景スニペットを区別する。
- メタラーニングを用いてQATモジュールを訓練し、新規クラスに一般化可能で、推論時にも迅速に適応できるようにする。
- GTADやBMNなどの動画埋め込みネットワークとQATモジュールを統合し、非トリムド動画から文脈特徴を抽出する。
- トリムドおよび非トリムドの両設定をサポートし、既存のベンチマークと後方互換性を持つ。
実験結果
リサーチクエスチョン
- RQ1非トリムドサポート動画を用いて学習した少ショットTALモデルは、トリムド動画を用いた場合に比べて、より高い性能を達成できるか?
- RQ2非トリムド動画からの背景文脈を組み込むことで、少ショット状況下でのクラス内変動の処理能力が向上するか?
- RQ3クエリ適応型トランスフォーマー機構は、各クエリ動画に応じてベース分類器を動的に適応させることができ、局所化精度を向上させられるか?
- RQ4ActivityNetからTHUMOS、およびその逆のドメイン間転送において、提案手法はどのように一般化するか?
- RQ5先行の最先端手法と比較して、提案手法の計算効率はどの程度か?
主な発見
- 提案手法は、ActivityNetの1ショット設定で[Yang et al., 2020]を4.8% mAP@0.5上回り、5ショット設定では6.2%上回る。
- ActivityNetからTHUMOSへのクロスドメイン転送設定では、1ショットで45.9% mAP@0.5、5ショットで54.4% mAP@0.5を達成し、先行の最先端手法をそれぞれ4.8ポイントおよび6.2ポイント上回る。
- 1タスクあたり0.83秒(単一のRTX2080Ti GPU)の推論速度を維持しており、[Yang et al., 2020]と同等の速度であり、効率性に悪影響がないことが示された。
- GTADバックボーンの深層(例:レイヤー5)が浅層よりも優れた性能を示し、コストパフォーマンスの観点から最適な埋め込みレイヤーとしてレイヤー5が選択された。
- アブレーションスタディにより、クエリ適応型トランスフォーマーが、多様な動画文脈下でのクラス内変動の処理において顕著に性能を向上させることが確認された。
- ドメイン間での一般化性能が高く、ActivityNet→THUMOSおよびTHUMOS→ActivityNetの両方向で一貫した性能向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。