Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Representations for Video Contrastive Learning

Jungin Park, Jiyoung Lee|arXiv (Cornell University)|Apr 8, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文は、混合ガウス分布を用いて動画クリップを確率的分布としてモデル化することで、データオーグメンテーションに依存せずに不確実性を考慮した対照学習を可能にする自己教師付き動画表現学習手法ProViCoを提案する。これらの確率的埋め込みからサンプリングし、確率的対照損失を用いることで、行動認識および動画検索の分野でUCF101およびHMDB51で最先端の性能を達成する。

ABSTRACT

This paper presents Probabilistic Video Contrastive Learning, a self-supervised representation learning method that bridges contrastive learning with probabilistic representation. We hypothesize that the clips composing the video have different distributions in short-term duration, but can represent the complicated and sophisticated video distribution through combination in a common embedding space. Thus, the proposed method represents video clips as normal distributions and combines them into a Mixture of Gaussians to model the whole video distribution. By sampling embeddings from the whole video distribution, we can circumvent the careful sampling strategy or transformations to generate augmented views of the clips, unlike previous deterministic methods that have mainly focused on such sample generation strategies for contrastive learning. We further propose a stochastic contrastive loss to learn proper video distributions and handle the inherent uncertainty from the nature of the raw video. Experimental results verify that our probabilistic embedding stands as a state-of-the-art video representation learning for action recognition and video retrieval on the most popular benchmarks, including UCF101 and HMDB51.

研究の動機と目的

  • 複雑でノイズの多い動画分布の高次元の不確実性を捉えることに失敗する決定論的動画埋め込みの限界を是正すること。
  • 動画コンテンツを歪めたり性能を低下させたりする可能性がある、慎重なデータオーグメンテーション戦略への依存を排除すること。
  • 全動画分布を確率的混合分布としてモデル化し、不確実性を考慮したサンプリングによって耐障害性の高い対照学習を可能にすること。
  • ノイズや不確実性の高いサンプルの影響を最小限に抑えながら、異なる動画間の意味的に関連するペアから学習することで表現品質を向上させること。
  • 不確実性を原理的かつ的確に推定し、モデル性能と相関付ける方法を提供することで、障害分析や信頼性推定・困難度推定を可能にすること。

提案手法

  • 各動画クリップを、ニューラルネットワークによって学習される平均と分散を持つ正規分布として埋め込み空間に表現する。
  • クリップレベルの分布を組み合わせることで、時間的ダイナミクスの全分布を捉えるために混合ガウス分布(MoG)として全動画をモデル化する。
  • 決定論的点ペアではなく、MoG分布からのサンプル間の確率的距離に基づいて、ポジティブおよびネガティブペアを構築する。
  • 不確実性を組み込むために、高分散(ノイズの高い)サンプルの影響を弱めるよう設計された、ソフト対照学習にインspiredされた確率的対照損失を導入する。
  • 推論時に1動画あたりK=10の埋め込みをモンテカルロサンプリングすることで、全MoG分布を近似し、耐障害性を向上させる。
  • 分布の凝縮性と識別性のバランスを取るために、ハイパーパramータβを用いたKLダイバージェンス正則化を適用し、β=10−4が最適であると判明した。

実験結果

リサーチクエスチョン

  • RQ1決定論的点埋め込みと比較して、動画クリップを確率的分布としてモデル化することで、自己教師付き動画表現学習の性能が向上するか?
  • RQ2不確実性を考慮した対照学習は、ノイズの多いまたは不適切にオーグメントされた動画サンプルが表現品質に与える悪影響を軽減するか?
  • RQ3確率的埋め込みは、データオーグメンテーションに依存せずに、異なる動画間の意味的に関連する関係を捉えることができるか?
  • RQ4動画表現の不確実性と下流タスクの性能の相関関係は何か? また、その不確実性はモデルの信頼性や障害発生確率の推定に利用可能か?
  • RQ5提案手法は、時間的または空間的データオーグメンテーションを用いず、UCF101 や HMDB51 といった標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • ProViCoは、ResNet-50バックボーンを用いてUCF101で94.8%、HMDB51で72.1%の最先端の行動認識精度を達成し、先行する自己教師付き手法を上回る。
  • 最適なKLダイバージェンス正則化ハイパーパramータβ=10−4は、分布の凝縮性と識別性のバランスをとるのに適しており、βが小さすぎたり大きすぎたりすると性能が低下することが判明した。
  • サンプリングされた埋め込み数Kを増やすことで性能が向上する。これはMoGのモンテカルロ近似が改善するためであり、K=10は計算的トレードオフとして選択された。
  • 動画の不確実性と検索性能の間に負の相関関係が存在する:不確実性が高くなるとトップ1精度が低下する。これは不確 Promise が予測の困難度を信頼できる代理指標として機能することを裏付けている。
  • 訓練過程を通じてモデルは不確実性を最小化するよう学習し、UCF101における検索性能の向上とその低下が相関していることが確認された。
  • 可視化とアブレーションの結果から、本手法が複雑な動画分布を効果的にモデル化しており、ノイズや損傷のあるサンプルへの感受性を低減できていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。