Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Contrastive Graph Learning for Video Action Recognition and Retrieval

Yang Liu, Keze Wang|arXiv (Cornell University)|Jan 4, 2021
Human Pose and Action Recognition参考文献 65被引用数 9
ひとこと要約

本稿では、動画内のマルチスケール時系列的依存関係を、局所的および相対的スニペット間時系列グラフ上でハイブリッドグラフ対照的学習戦略を用いてモデル化する自己教師付き手法であるTemporal Contrastive Graph Learning (TCGL) を提案する。ランダムなエッジ削除とノードマスキングを用いて相関する視覚を生成し、アダプティブなスニペット順序予測モジュールを統合することで、TCGLは複数の3D CNNバックボーンを用いたアクション認識および動画検索ベンチマークで最先端の性能を達成した。

ABSTRACT

Attempt to fully discover the temporal diversity and chronological characteristics for self-supervised video representation learning, this work takes advantage of the temporal dependencies within videos and further proposes a novel self-supervised method named Temporal Contrastive Graph Learning (TCGL). In contrast to the existing methods that ignore modeling elaborate temporal dependencies, our TCGL roots in a hybrid graph contrastive learning strategy to jointly regard the inter-snippet and intra-snippet temporal dependencies as self-supervision signals for temporal representation learning. To model multi-scale temporal dependencies, our TCGL integrates the prior knowledge about the frame and snippet orders into graph structures, i.e., the intra-/inter- snippet temporal contrastive graphs. By randomly removing edges and masking nodes of the intra-snippet graphs or inter-snippet graphs, our TCGL can generate different correlated graph views. Then, specific contrastive learning modules are designed to maximize the agreement between nodes in different views. To adaptively learn the global context representation and recalibrate the channel-wise features, we introduce an adaptive video snippet order prediction module, which leverages the relational knowledge among video snippets to predict the actual snippet orders. Experimental results demonstrate the superiority of our TCGL over the state-of-the-art methods on large-scale action recognition and video retrieval benchmarks.

研究の動機と目的

  • 既存の自己教師付き動画学習手法が、短期的または長期的依存関係を単独でモデル化しているという制限を解消すること。
  • 局所的(短期的)スニペット内および相対的(長期的)スニペット間の両方の時系列的依存関係を発見・活用し、より優れた表現学習を実現すること。
  • マルチスケール時系列構造を自己教師信号として統合し、グラフベースの対照的学習フレームワークを共同で構築すること。
  • スニペット間の関係的知識を用いて、グローバルな文脈理解とチャネル再調整を向上させる、アダプティブな動画スニペット順序予測モジュールを導入すること。
  • 大規模な動画アクション認識および検索ベンチマークにおいて、TCGLの有効性を実証すること。

提案手法

  • 動画を固定長のスニペットにサンプリングし、各スニペットをフレーム集合にさらに分割することで、マルチスケール時系列ダイナミクスを捉える。
  • 2種類のグラフ構造を構築する:スニペット内フレーム集合のためのイントラスニペット・グラフと、時間的順序に従ったスニペット間のためのインタースニペット・グラフであり、時系列順序に関する事前知識を組み込む。
  • 対照的学習のための相関する複数のグラフ視覚を生成するために、ランダムなエッジ削除とノード特徴マスキングを適用する。
  • 対照的学習モジュールは、異なる視覚内のノード間の特徴一致を最大化することで、頑健な時系列表現学習を促進する。
  • 真の時間的順序を予測するアダプティブなスニペット順序予測ヘッドを導入し、スニペット間の関係的知識を活用してグローバルな文脈理解を向上させる。
  • バックボーンネットワーク(3D CNN)は、大規模なラベルなし動画データ上でTCGLを用いて事前学習した後、下流タスクの微調整に用いる。

実験結果

リサーチクエスチョン

  • RQ1イントラスニペットおよびインタースニペットの時系列的依存関係を同時にモデル化することで、自己教師付き動画表現学習の性能が向上するか?
  • RQ2マルチスケール時系列構造を自己教師信号として活用するグラフ対照的学習フレームワークは、どの程度有効か?
  • RQ3アダプティブなスニペット順序予測は、学習された動画表現の判別能力を向上させられるか?
  • RQ4TCGLは、アクション認識および検索タスクにおいて、異なる3D CNNバックボーンおよびベンチマークに一般化可能か?
  • RQ5性能および頑健性の観点から、TCGLは最先端の自己教師付き手法と比較して優れているか?

主な発見

  • R3Dバックボーンを用いたUCF101では、TCGLがトップ1正解率72.4%を達成し、以前のSOTA手法(V-pace)を2.6ポイント上回った。
  • R3Dを用いたKinetics-400では、TCGLがトップ1正解率75.7%を達成し、前回SOTA(V-pace)を2.8ポイント上回った。
  • C3Dバックボーンを用いたUCF101における動画検索では、TCGLがトップ50検索正解率77.7%を達成し、以前のSOTA(V-pace)を2.2ポイント上回った。
  • HMDB51では、R(2+1)Dバックボーンを用いたTCGLがトップ50検索正解率80.2%を達成し、以前のSOTAを3.1ポイント上回った。
  • 活性マップの可視化により、TCGLが動画内の動きパターンと整合する判別性の高い空間時系列表現を学習していることが確認された。
  • アブレーションスタディの結果、イントラスニペットおよびインタースニペットのグラフ学習コンponentsの両方が性能向上に顕著に寄与しており、マルチスケール設計の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。