Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Video Representation Learning With Odd-One-Out Networks

Basura Fernando, Hakan Bilen|arXiv (Cornell University)|Nov 21, 2016
Human Pose and Action Recognition参考文献 41被引用数 7
ひとこと要約

本論文は、一連の正しい順序で並べられた動画クリップのうち、時系列的に誤って並べ替えられた1つのクリップを特定するように訓練する、自己教師あり学習手法であるOdd-One-Out Networks (O3N) を提案する。この手法は、ラベルなしの動画データのみを用いてUCF101で60.3%、HMDB51で32.5%の精度を達成し、両ベンチマークで先行する自己教師あり手法を10%以上上回った。

ABSTRACT

We propose a new self-supervised CNN pre-training technique based on a novel auxiliary task called "odd-one-out learning". In this task, the machine is asked to identify the unrelated or odd element from a set of otherwise related elements. We apply this technique to self-supervised video representation learning where we sample subsequences from videos and ask the network to learn to predict the odd video subsequence. The odd video subsequence is sampled such that it has wrong temporal order of frames while the even ones have the correct temporal order. Therefore, to generate a odd-one-out question no manual annotation is required. Our learning machine is implemented as multi-stream convolutional neural network, which is learned end-to-end. Using odd-one-out networks, we learn temporal representations for videos that generalizes to other related tasks such as action recognition. On action classification, our method obtains 60.3\% on the UCF101 dataset using only UCF101 data for training which is approximately 10% better than current state-of-the-art self-supervised learning methods. Similarly, on HMDB51 dataset we outperform self-supervised state-of-the art methods by 12.7% on action classification task.

研究の動機と目的

  • 人間がアノテートした行動ラベルに依存しない自己教師ありの動画表現学習手法の開発。
  • ラベルなしデータのみを用いて動画の時間的整合性を学ぶ課題への対処。
  • ImageNetでの事前学習や外部の教師信号なしに、下流の行動認識タスクにおける動画特徴の一般化性能の向上。
  • 関連する複数の動画クリップの中から奇抜な1つを特定するという、新しい補助タスクを通じた類推的推論の探求。

提案手法

  • 各ブランチがN+1個のクリップのうち1つの動画クリップを処理するマルチブランチCNNアーキテクチャを採用する。
  • 奇抜な1つタスクは、N個の正しい時間的順序を持つクリップと、1つの誤った順序のクリップのうち、誤ったものを特定するものである。
  • 時間的整合性を教師信号として活用し、エンド・トゥ・エンドに訓練されたネットワークが奇抜なクリップを予測する。
  • 差分の和、ダイナミック画像、フレームの差分の積み重ねという3つの動画クリップ符号化手法を評価する。
  • 訓練中に奇抜なクリップをN+1個のクリップのうちランダムに配置することで、自明な解法を防ぐ。
  • 標準的なUCF101およびHMDB51の分割を用いて、行動分類タスクで特徴をファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1奇抜な1つ推論に基づく自己教師あり学習アプローチは、人間がアノテートしたラベルなしに効果的な動画表現を学習できるか?
  • RQ2奇抜な1つ学習は、既存の自己教師あり手法と比較して、行動認識タスクにどの程度一般化できるか?
  • RQ3差分の和やダイナミック画像といった異なる動画クリップ符号化戦略は、本手法に恩恵をもたらすか?
  • RQ4UCF101 や HMDB51 といった標準ベンチマークで、学習された特徴は最先端の自己教師あり手法を上回るか?
  • RQ5奇抜な1つタスクは、動画内の空間的・時間的運動パターンの学習をどの程度促進するか?

主な発見

  • O3N手法は、UCF101データのみを用いてトレーニングした結果、UCF101でトップ1精度60.3%を達成し、先行する自己教師あり手法より10%の向上を示した。
  • HMDB51では32.5%の精度を達成し、前回の最先端手法を12.7ポイント以上上回った。
  • 差分の積み重ねの動画クリップエンコーダーが評価された3つのエンコーダーの中で最高の性能を示し、UCF101で60.3%、HMDB51で32.5%の精度を達成した。
  • 学習されたフィルタの可視化結果から、異なるエンコーダーごとに明確なパターンが観察され、ネットワークがタスク固有の運動表現を学習していることが示された。
  • 本手法は異なる動画クリップ符号化技術に対しても一般化可能であり、ランダム初期化やベースライン自己教師あり手法と比較して一貫した改善を示した。
  • ImageNetでの事前学習がなくてもO3Nは強力な性能を発揮したため、教師あり事前学習の完全に自己教師ありの代替手段としての可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。