Skip to main content
QUICK REVIEW

[論文レビュー] Representation Learning with Video Deep InfoMax

Hjelm, R Devon|arXiv (Cornell University)|Jul 27, 2020
Human Pose and Action Recognition参考文献 71被引用数 15
ひとこと要約

本稿では、空間的・時間的ネットワーク構造を活用して、元のレートおよび時間的にダウンサンプルされた動画シーケンスからビューを生成することで、DeepInfoMaxを動画に拡張した自己教師付き動画表現学習手法であるVideo Deep InfoMax(VDIM)を紹介する。VDIMは、自己教師付き事前学習と微調整のみを用いて、Kineticsで事前学習されたアクション認識で最先端性能を達成し、UCF-101では新たなSoTAを樹立した。

ABSTRACT

Self-supervised learning has made unsupervised pretraining relevant again for difficult computer vision tasks. The most effective self-supervised methods involve prediction tasks based on features extracted from diverse views of the data. DeepInfoMax (DIM) is a self-supervised method which leverages the internal structure of deep networks to construct such views, forming prediction tasks between local features which depend on small patches in an image and global features which depend on the whole image. In this paper, we extend DIM to the video domain by leveraging similar structure in spatio-temporal networks, producing a method we call Video Deep InfoMax(VDIM). We find that drawing views from both natural-rate sequences and temporally-downsampled sequences yields results on Kinetics-pretrained action recognition tasks which match or outperform prior state-of-the-art methods that use more costly large-time-scale transformer models. We also examine the effects of data augmentation and fine-tuning methods, accomplishingSoTA by a large margin when training only on the UCF-101 dataset.

研究の動機と目的

  • 空間的・時間的特徴構造を活用して、画像から動画へとDeepInfoMax(DIM)フレームワークを拡張すること。
  • 動画のビューを用いた自己教師付き事前学習が、アクション認識において高価なトランスフォーマー基盤モデルと同等またはそれを上回る性能を達成できるかを検証すること。
  • 自己教師付き動画表現学習におけるデータ拡張および微調整戦略の影響を評価すること。
  • 自己教師付き事前学習と標準的な微調整のみを用いて、UCF-101で最先端性能を達成すること。

提案手法

  • VDIMは、元のレートおよび時間的にダウンサンプルされた動画クリップからビューを構築し、多様な空間的・時間的ビューを生成する。
  • 空間的・時間的畳み込みネットワークから得られる局所的およびグローバルな特徴表現を用いて、パッチ間と全クリップ間の対照損失を計算する。
  • 局所的特徴とグローバルな動画レベルの表現の間の相互情報量を最大化することで、対照学習を実装する。
  • 時間的クロップやフレームサンプリングを含むデータ拡張を動画クリップに適用してビューを作成する。
  • 同じ動画の異なるビューからの特徴の一致を促進する対照的目的関数を用いて、モデルを事前学習する。
  • 下流のアクション認識ベンチマークで、標準的な線形またはエンドツーエンド分類ヘッドを用いて微調整を実施する。

実験結果

リサーチクエスチョン

  • RQ1空間的・時間的特徴を活用することで、DeepInfoMaxフレームワークを動画表現学習に成功裏に拡張できるか?
  • RQ2元のレートとダウンサンプルされた動画ビューの両方を用いることで、単一ビュー手法と比較して自己教師付き動画表現学習が向上するか?
  • RQ3アクション認識において、VDIMは大規模なトランスフォーマー基盤モデルと比較して、性能および計算コストの面で優れているか?
  • RQ4データ拡張および微調整戦略が、VDIMの最終的精度に与える影響は何か?
  • RQ5自己教師付き事前学習と標準的な微調整のみを用いて、VDIMはUCF-101で最先端性能を達成できるか?

主な発見

  • VDIMは、より大規模で高価なトランスフォーマー基盤アーキテクチャを用いた先行研究と同等またはそれを上回る性能を、Kineticsで事前学習されたアクション認識で達成した。
  • UCF-101データセットでは、自己教師付き事前学習と標準的な微調整のみを用いて、VDIMが最先端の結果を達成した。
  • 元のレートおよび時間的にダウンサンプルされた動画シーケンスをビューとして用いることで、単一ビューのベースラインと比較して表現品質が顕著に向上した。
  • データ拡張および微調整戦略は、特にUCF-101のような小さなデータセットにおいて、性能を最大化する上で極めて重要な役割を果たした。
  • VDIMは、大規模モデルを用いずに、効果的な自己教師付き学習が動画分野で達成可能であることを示した。計算コストを低減しつつ、高い精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。