[論文レビュー] Fine-grained Temporal Contrastive Learning for Weakly-supervised Temporal Action Localization
本論文は、微細な時間的差異を学習するために微分可能動的計画法を活用する、弱教師付き時間的行動局所化のための新規フレームワークであるFine-grained Temporal Contrastive Learning (FTCL)を提案する。2つの補完的コントラスト学習目的、すなわち微細なシーケンス距離(FSD)と最長共通部分列(LCS)の対比を導入することで、行動と背景の分離を強化し、分類と局所化の間のタスクギャップを低減し、THUMOS14およびActivityNet-1.2ベンチマークで最先端の性能を達成した。
We target at the task of weakly-supervised action localization (WSAL), where only video-level action labels are available during model training. Despite the recent progress, existing methods mainly embrace a localization-by-classification paradigm and overlook the fruitful fine-grained temporal distinctions between video sequences, thus suffering from severe ambiguity in classification learning and classification-to-localization adaption. This paper argues that learning by contextually comparing sequence-to-sequence distinctions offers an essential inductive bias in WSAL and helps identify coherent action instances. Specifically, under a differentiable dynamic programming formulation, two complementary contrastive objectives are designed, including Fine-grained Sequence Distance (FSD) contrasting and Longest Common Subsequence (LCS) contrasting, where the first one considers the relations of various action/background proposals by using match, insert, and delete operators and the second one mines the longest common subsequences between two videos. Both contrasting modules can enhance each other and jointly enjoy the merits of discriminative action-background separation and alleviated task gap between classification and localization. Extensive experiments show that our method achieves state-of-the-art performance on two popular benchmarks. Our code is available at https://github.com/MengyuanChen21/CVPR2022-FTCL.
研究の動機と目的
- フレーム単位のアノテーションが不足することに起因する弱教師付き時間的行動局所化(WSAL)における深刻な曖昧性を解消すること。
- 行動と背景の分離能を向上させ、動画レベルの分類と時間的局所化の間のタスクギャップを低減すること。
- 動画間の微細な時間的差異を、より良い表現学習のためのインダクティブバイアスとして活用すること。
- 既存のWSAL手法に追加コストをかけずに、モデルに依存しない、侵襲的でないコントラスト学習フレームワークを設計すること。
提案手法
- 時間的シーケンス関係のエンドツーエンド学習を可能にするため、微分可能動的計画法の定式化を提案する。
- マッチ、挿入、削除の操作を用いてスニペットレベルの関係をモデル化する微細なシーケンス距離(FSD)対比を導入する。
- 2つの動画間の最長共通時間的部分構造を抽出する最長共通部分列(LCS)対比を設計する。
- FSDとLCSの目的関数を組み合わせ、行動と背景の分離能の向上と分類から局所化への転移性能の改善を同時に最適化する。
- トリムド動画や追加の監視情報が不要な構造的動画関係を活用するコントラスト学習戦略を採用する。
- 提案されたモジュールを既存のWSALフレームワークにプラグインとして統合し、推論コストを増加させない。
実験結果
リサーチクエスチョン
- RQ1動画シーケンス間の微細な時間的差異は、弱教師付き行動局所化における効果的なインダクティブバイアスとして機能するか?
- RQ2弱教師付き設定において、行動-背景および行動-行動の両方の時間的関係を効果的にモデル化する方法は何か?
- RQ3微分可能動的計画法を用いることで、アラインドまたはトリムド動画を必要とせずにシーケンス同士の関係を学習できるか?
- RQ4FSDとLCS対比を組み合わせることで、個々の目的関数に比べて行動-背景分離能と局所化精度が向上するか?
- RQ5提案されたコントラスト学習フレームワークは、既存のWSALモデルに普遍的に適用可能か?
主な発見
- FTCLはTHUMOS14で最先端の性能を達成し、すべてのIoU閾値における平均平均精度(mAP@t-IoU)が43.6%を記録した。
- ActivityNet-1.2では、mAP@t-IoUが43.6%を達成し、既存のSOTA手法を上回った。
- アブレーションスタディの結果、FSDおよびLCS対比の両方が有効かつ補完的であり、両方を含む完全なモデルが、いずれかのコンponentsを除外したバージョンを上回ることを確認した。
- FSDおよびLCSを標準的な微分可能DTWに置き換えると結果が劣化し、提案されたコントラスト目的の優位性を裏付けた。
- STPN、W-TALC、CoLAの3つの強力なベースラインに対して、mAPが最大+1.9%向上し、本手法の汎用性と補完的性質を示した。
- フレームワークはモデルに依存せず、推論時にも追加の計算コストを発生させないため、実世界の展開に実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。