Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics

Jiangliu Wang, Jianbo Jiao|arXiv (Cornell University)|Apr 7, 2019
Human Pose and Action Recognition参考文献 45被引用数 9
ひとこと要約

本論文は、動きや外見の統計量(代表的な動き領域、その方向、色の多様性など)を予測することで、空間的・時間的統計パターンを利用した自己教師あり動画表現学習手法を提案する。空間的・時間的統計パターンに基づく直感的で人間の認知と整合性の高い教師信号を用いてC3Dを無ラベル動画で事前学習することで、アクション認識(UCF101で61.2%)およびアクション類似度ラベル付けや動的シーン認識といった転移学習タスクで最先端の性能を達成した。

ABSTRACT

We address the problem of video representation learning without human-annotated labels. While previous efforts address the problem by designing novel self-supervised tasks using video data, the learned features are merely on a frame-by-frame basis, which are not applicable to many video analytic tasks where spatio-temporal features are prevailing. In this paper we propose a novel self-supervised approach to learn spatio-temporal features for video representation. Inspired by the success of two-stream approaches in video classification, we propose to learn visual features by regressing both motion and appearance statistics along spatial and temporal dimensions, given only the input video data. Specifically, we extract statistical concepts (fast-motion region and the corresponding dominant direction, spatio-temporal color diversity, dominant color, etc.) from simple patterns in both spatial and temporal domains. Unlike prior puzzles that are even hard for humans to solve, the proposed approach is consistent with human inherent visual habits and therefore easy to answer. We conduct extensive experiments with C3D to validate the effectiveness of our proposed approach. The experiments show that our approach can significantly improve the performance of C3D when applied to video classification tasks. Code is available at https://github.com/laura-wang/video_repres_mas.

研究の動機と目的

  • 人間がラベルを付与しない状況で強力な空間時間的動画表現を学習する課題に対処すること。
  • 従来の自己教師あり手法が単一または2フレームでのみ動作するという制限を克服し、時間的モデリングを必要とする動画タスクに不適切であることを解決すること。
  • 人間の視覚的認知と整合的で直感的な自己教師ありタスクを設計し、C3Dのような3次元畳み込みニューラルネットワークの有効な事前学習を可能にすること。
  • アクション認識を越えて、動的シーン認識やアクション類似度ラベル付けといった下流タスクへの特徴の転送可能性を実証すること。

提案手法

  • 動きおよび外見の統計量(例:最も顕著な動き領域とその方向、色の多様性や安定性が著しい領域)を抽出する自己教師ありタスクを設計する。
  • 複数のグリッドパターンを用いて各フレームを空間的領域に分割し、局所的な空間時間的統計量を抽出する。
  • これらの統計量(例:代表的な動きベクトル、領域内の代表色、時間的色分散)を教師信号として事前学習に用いる。
  • 3次元畳み込みニューラルネットワーク(C3D)を、生動画入力からこれらの数値的統計量を回帰するように学習させ、空間時間的特徴のエンドツーエンド学習を可能にする。
  • 人間の視覚系における動きおよび外見処理経路の生物学的妥当性を根拠に、統計的目的の設計を支援する。
  • これらの統計量予測タスクを用いて、大規模な無ラベル動画データ上でC3Dネットワークを事前学習し、その後下流タスクで微調整するか、特徴抽出器として利用する。

実験結果

リサーチクエスチョン

  • RQ1直感的で人間の認知と整合性のある動きおよび外見の統計パターンに基づく自己教師あり学習は、動画の空間時間的表現学習を向上させ得るか?
  • RQ2動きおよび外見の統計量を予測することは、ランダムまたは教師あり事前学習と比較して、動画認識タスクにおける転移性能を向上させるか?
  • RQ3自己教師ありで事前学習されたC3Dモデルは、アクション類似度ラベル付けや動的シーン認識といった下流タスクに効果的に一般化可能か?
  • RQ4既存の自己教師あり動画学習手法と比較して、本手法の性能および特徴品質はどのように優れているか?

主な発見

  • 提案された自己教師ありタスクでC3Dを事前学習すると、UCF101でトップ1正解率61.2%を達成し、ランダム初期化からの学習(45.4%)と比べ顕著な向上を示した。
  • ASLANデータセットにおけるアクション類似度ラベル付けタスクで、人間がラベルを付与したデータから学習したC3Dモデル(58.3%)を上回り、59.4%の正解率を達成した。
  • UCF101で微調整した場合、自己教師あり事前学習モデルはASLANで62.3%の正解率を達成し、STIPのような手作業特徴(60.9%)をも上回った。
  • YUPENNの動的シーン認識データセットでは、自己教師ありC3Dモデルが90.2%の正解率を達成し、先行する自己教師あり手法(86.9%)および手作業特徴を上回った。
  • ゼロショット転送においても優れた一般化性能を示した:事前学習中にASLANデータセットを一度も見ない状況で59.4%の正解率を達成し、強力な転送性を示した。
  • 性能向上の要因は、生物学的にインspiredされた統計量予測タスクを通じて、より文脈を考慮した意味的意味のある空間時間的特徴をモデルが学習したことに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。