Skip to main content
QUICK REVIEW

[論文レビュー] Video Jigsaw: Unsupervised Learning of Spatiotemporal Context for Video Action Recognition

Unaiza Ahsan, Rishi Madhok|arXiv (Cornell University)|Aug 22, 2018
Human Pose and Action Recognition参考文献 52被引用数 5
ひとこと要約

本論文では、複数の動画フレームからなるパッチを用いてジャイガーパズルを形成し、そのパズルを解くことで空間的および時間的コンテキストを同時に学習する自己教師あり手法であるVideo Jigsawを提案する。物体追跡や光流体を用いないにもかかわらず、HMDB51では最先端の性能を達成し、UCF101およびPASCAL VOCでも競争力のある結果を示し、Kineticsでの事前学習から強力なゼロショット転移が可能であることを示している。

ABSTRACT

We propose a self-supervised learning method to jointly reason about spatial and temporal context for video recognition. Recent self-supervised approaches have used spatial context [9, 34] as well as temporal coherency [32] but a combination of the two requires extensive preprocessing such as tracking objects through millions of video frames [59] or computing optical flow to determine frame regions with high motion [30]. We propose to combine spatial and temporal context in one self-supervised framework without any heavy preprocessing. We divide multiple video frames into grids of patches and train a network to solve jigsaw puzzles on these patches from multiple frames. So the network is trained to correctly identify the position of a patch within a video frame as well as the position of a patch over time. We also propose a novel permutation strategy that outperforms random permutations while significantly reducing computational and memory constraints. We use our trained network for transfer learning tasks such as video activity recognition and demonstrate the strength of our approach on two benchmark video action recognition datasets without using a single frame from these datasets for unsupervised pretraining of our proposed video jigsaw network.

研究の動機と目的

  • 物体追跡や光流体を用いずに、前処理を重視せずに空間的および時間的コンテキストを共同で活用する自己教師あり動画表現学習手法の開発。
  • 動画内の運動に関連するパッチを抽出するための物体追跡や光流体への依存を排除すること。
  • 空間的および時間的整合性を保ちつつ、メモリと計算量を削減する効率的なパズルの並べ替え戦略の設計。
  • 学習された表現の下流タスクへの転移性を動画行動認識および画像分類タスクで評価すること。
  • 単に簡単なパッチ抽出を用いるだけで、大規模なラベルなし動画データから動画理解に有効な表現を取得できることを示すこと。

提案手法

  • 複数の動画フレームを空間的パッチのグリッドに分割し、空間的および時間的領域でパッチを並べ替えることでジャイガーパズルを構築する。
  • 深層ニューラルネットワークを、シャッフルされたパズルにおける各パッチの元の空間的および時間的位置を予測するように訓練する。
  • 局所的な空間的および時間的整合性を保ちつつ、多様でメモリ効率の良い並べ替えを可能にする、新しい制約付き並べ替え戦略を導入する。
  • RGBフレームのみを用いて、アクションラベルなしでKineticsなどの大規模な動画データセットでネットワークを事前学習する。
  • 下流の動画行動認識ベンチマーク(UCF101 や HMDB51)で微調整することで、転移学習を実施する。
  • 画像分類(PASCAL VOC 2007)でも評価を行い、動画事前学習からのゼロショット一般化性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1物体追跡や光流体を必要とせずに、自己教師あり学習フレームワークが動画の空間的および時間的コンテキストを共同で活用できるか?
  • RQ2動画パッチに対するジャイガーパズルタスクが、下流の動画行動認識タスクに一般化しやすい表現を生成するか?
  • RQ3制約付き並べ替え戦略は、ランダムな並べ替えと比較して、動画ジャイガーパズル学習における性能と効率を向上させるか?
  • RQ4Kineticsで事前学習したモデルは、より小さくアクティビティが多様なUCF101 や HMDB51のようなデータセットにどれほど一般化するか?
  • RQ5画像固有の事前学習なしで、動画で事前学習したモデルが画像分類タスクで競争力のある性能を示せるか?

主な発見

  • 微調整後、HMDB51データセットで63.6%のトップ-1正解率を達成し、このベンチマークで過去のすべての非教師あり事前学習手法を上回った。
  • UCF101では85.2%の正解率を達成し、非教師あり事前学習アプローチの中での最先端性能と同等であった。
  • 画像分類タスクへの一般化が効果的に実現され、PASCAL VOC 2007で63.6%のmAPを達成し、多くの動画ベースの半教師あり手法を上回った。
  • 提案された制約付き並べ替え戦略により、多様で効率的な並べ替えが可能になり、特に12パッチの場合にランダム並べ替えより性能が向上した。
  • Kineticsで3フレームのみを用いても強力な結果が得られたことから、大規模なラベルなし動画データと単純なパッチ抽出だけで、効果的な自己教師あり学習が可能であることが示された。
  • 学習された特徴には意味のあるインダクティブバイアスが現れており、初期の畳み込みフィルタの可視化から方向性に敏感なエッジ検出器が観察された。これは、教師なし条件下でも構造的な特徴学習が行われていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。