Skip to main content
QUICK REVIEW

[論文レビュー] Back to the Future: Cycle Encoding Prediction for Self-supervised Contrastive Video Representation Learning

Xinyu Yang, Majid Mirmehdi|Explore Bristol Research|Oct 14, 2020
Human Pose and Action Recognition参考文献 56被引用数 5
ひとこと要約

本稿では、潜在特徴空間における双方向時系列サイクル閉じ込みを強制することで、アクション認識の性能を向上させる自己教師付き動画表現学習手法であるサイクル符号化予測(CEP)を提案する。共通のエンコーダーと二重の予測ヘッドを用いて、サイクル整合性と対照的特徴分離を同時に最適化することで、UCF101およびHMDB51で最先端の性能を達成し、ベースライン手法よりも最大3.9%の精度向上を実現した。

ABSTRACT

In this paper we show that learning video feature spaces in which temporal cycles are maximally predictable benefits action classification. In particular, we propose a novel learning approach termed Cycle Encoding Prediction (CEP) that is able to effectively represent high-level spatio-temporal structure of unlabelled video content. CEP builds a latent space wherein the concept of closed forward-backward as well as backward-forward temporal loops is approximately preserved. As a self-supervision signal, CEP leverages the bi-directional temporal coherence of the video stream and applies loss functions that encourage both temporal cycle closure as well as contrastive feature separation. Architecturally, the underpinning network structure utilises a single feature encoder for all video snippets, adding two predictive modules that learn temporal forward and backward transitions. We apply our framework for pretext training of networks for action recognition tasks. We report significantly improved results for the standard datasets UCF101 and HMDB51. Detailed ablation studies support the effectiveness of the proposed components. We publish source code for the CEP components in full with this paper.

研究の動機と目的

  • 未編集動画の内在する時系列構造を活用して、より優れた動画表現学習を実現する自己教師付き学習手法の開発。
  • 人間によるアノテーションなしに、意味的に意味のある、時間的に一貫性のある特徴空間を学習する課題への対処。
  • 時系列サイクル閉じ込みに基づく新しい事前学習タスクの導入により、動画埋め込みの一般化性能と特徴品質の向上。
  • 従来のフレームレベル予測やトラッキングに基づく手法と比較して、サイクル整合性が自己教師信号としてどれほど有効であるかの検証。
  • メモリバンク、正規化手法、オプティカルフロー増強などのアーキテクチャ的要因がモデル性能に与える影響の評価。

提案手法

  • CEPは、動画スニペットを潜在空間にマップするための単一の共有動画エンコーダーを用い、前方および後方の時系列遷移をそれぞれ別々のヘッドで予測する。
  • 前方から過去を予測し、その後方から未来を予測することで元の過去を回復するという閉ループを形成するように、サイクル整合性を強制する。
  • 類似したクリップ同士が潜在空間で近づき、異なるクリップ同士が遠ざかるように、同時に対照的損失を適用する。
  • 対照学習中に負例特徴を格納するためのメモリバンクを用い、より大きな有効バッチサイズを実現し、表現品質を向上させる。
  • 情報漏洩を防ぐために、時系列グループ間の整合性を保つために、同期型時系列グループ正規化(Sync-TGN)を導入する。
  • クリップ間の動きを曇らせるようにオプティカルフローを変換することで、サイクル予測タスクの難易度を高め、モデルの耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1潜在特徴空間における双方向的時系列サイクル閉じ込みを強制することで、アクション認識のための動画表現学習が向上するか?
  • RQ2将来のフレーム予測やフレームレベル類似性に基づく対照学習と比較して、サイクル整合性は自己教師信号としてどれほど優れているか?
  • RQ3メモリバンク、Sync-TGN、オプティカルフロー増強といったアーキテクチャ的要因が、CEPフレームワーク全体の性能に与える寄与度はいかほどか?
  • RQ4時系列受容野長さが、CEPにおける学習済み表現の質に影響を与えるか?
  • RQ5CEPは、異なるバックボーンアーキテクチャーやデータセットに対してどれほど一般化可能か?

主な発見

  • サイクル整合性を導入しないベースラインと比較して、CEPはUCF101のトップ1精度を3.9%向上させ、提案された自己教師信号の有効性を示した。
  • サイクル整合性損失($\mathcal{L}_C$)は、事前学習の全期間にわたり性能を向上させ、179Kステップでは2.1%の向上、537Kステップでは5.4%の向上を示した。
  • 増幅時にクリップ間のオプティカルフローを曇らせる処理を施すと、224×224解像度で5.1%の性能向上が得られ、動きの手がかりに対する耐性が向上したことが示唆された。
  • 高いモーメンタム係数を有する動的メモリバンクは、静的または非使用のメモリバンクよりも性能を向上させ、対照学習におけるその価値を裏付けた。
  • 同期型時系列グループ正規化(Sync-TGN)は、標準的なバッチ正規化よりも3.6%の精度向上を達成し、自明な解のリスクを低減した。
  • 時系列受容野を1.5秒から3秒に拡大すると、性能が1.7%向上し、より長い文脈情報が意味的な動的特徴の学習に寄与することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。