Skip to main content
QUICK REVIEW

[論文レビュー] It Takes Two: Masked Appearance-Motion Modeling for Self-supervised Video Transformer Pre-training

Yuxin Song, Min Yang|arXiv (Cornell University)|Oct 11, 2022
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、ビデオトランスフォーマー内で分離されたデコーダーを用いて、同時に外見特徴と運動特徴をマスクして予測する自己教師付き動画表現学習フレームワーク、MAM2を提案する。外見特徴にはVQGANコード、運動特徴にはRGB差分を用いることで、VideoMAEと比較して最大50%少ない事前訓練エポック数で、Kinetics-400(82.3%)、Something-Something V2(71.3%)、UCF101(91.5%)、HMDB51(62.5%)で最先端性能を達成した。

ABSTRACT

Self-supervised video transformer pre-training has recently benefited from the mask-and-predict pipeline. They have demonstrated outstanding effectiveness on downstream video tasks and superior data efficiency on small datasets. However, temporal relation is not fully exploited by these methods. In this work, we explicitly investigate motion cues in videos as extra prediction target and propose our Masked Appearance-Motion Modeling (MAM2) framework. Specifically, we design an encoder-regressor-decoder pipeline for this task. The regressor separates feature encoding and pretext tasks completion, such that the feature extraction process is completed adequately by the encoder. In order to guide the encoder to fully excavate spatial-temporal features, two separate decoders are used for two pretext tasks of disentangled appearance and motion prediction. We explore various motion prediction targets and figure out RGB-difference is simple yet effective. As for appearance prediction, VQGAN codes are leveraged as prediction target. With our pre-training pipeline, convergence can be remarkably speed up, e.g., we only require half of epochs than state-of-the-art VideoMAE (400 v.s. 800) to achieve the competitive performance. Extensive experimental results prove that our method learns generalized video representations. Notably, our MAM2 with ViT-B achieves 82.3% on Kinects-400, 71.3% on Something-Something V2, 91.5% on UCF101, and 62.5% on HMDB51.

研究の動機と目的

  • 既存のマスクされた動画モデリング手法における時間的運動特徴の活用が限定的であるという問題に対処すること。
  • 自己教師付き動画事前学習における収束速度と表現品質を向上させること。
  • 外見と運動の予測タスクを分離することで、より効果的な空間時間特徴学習を実現すること。
  • 事前訓練エポック数を削減しながら、下流タスクの性能を維持または向上させること。
  • RGB差分とVQGANコードが、外見再構成と運動再構成のターゲットとして有効であるかを検証すること。

提案手法

  • エンコーダ・レグレッサー・デコーダの3段階パイプラインを設計し、レグレッサーが特徴エンコーディングと事前学習タスクの予測を分離する。
  • 2つの別々のデコーダーを用いる:1つはVQGANで符号化された視覚トークン(外見)の再構成を、もう1つはマスクされた動画チューブにおけるRGB差分(運動)の予測を担当する。
  • レグレッサーは可視チューブの埋め込みを投影し、マスクされたチューブの表現を予測することで、空間時間に依存しない特徴学習を可能にする。
  • RGB差分は、運動ダイナミクスを捉える上で単純かつ効果的であるため、運動ターゲットとして選択された。
  • フレームワークは、マスクされた動画パッチ再構成を用い、SSv2、UCF101、HMDB51データセットで事前学習されたViTベースのエンコーダを採用する。
  • 高いマスキング率を用いて事前学習を行い、外見再構成のためのVQGANコードは、オンザフライでトークナイザーを適用して生成する。

実験結果

リサーチクエスチョン

  • RQ1明示的な運動特徴モデリングは、マスクされた動画モデリングにおける自己教師付き動画表現学習を改善できるか?
  • RQ2外見と運動の予測を分離することで、収束速度が向上し、下流タスクの性能が向上するか?
  • RQ3マスクされた動画モデリング設定において、どの運動表現(例:オプティカルフロー、RGB差分、時間的順序)が最も効果的かつ効率的か?
  • RQ4VQGANコードは、動画事前学習における外見再構成ターゲットとして、頑健で意味的に意味のあるものとなるか?
  • RQ5VideoMAEなどの最先端手法と比較して、MAM2はどの程度事前訓練エポック数を削減しつつ、性能を維持または向上できるか?

主な発見

  • Kinetics-400では82.3%のトップ1精度を達成し、VideoMAEを+1.0%上回り、800エポックではなく400エポックでの事前学習で達成した。
  • 時間的アクションが豊富なSomething-Something V2データセットでは、71.3%の精度を記録し、VideoMAE(70.6%)を上回ったが、事前学習エポック数は半分だった。
  • UCF101とHMDB51では、それぞれ91.5%と62.5%の精度を達成し、VideoMAEを0.7%と1.4%上回ったが、事前学習エポック数は2.7倍と3倍少ない。
  • ViT-Lを用いた場合、800エポックでの事前学習でST-MAEとVideoMAEを上回り、600エポックでの事前学習でそれらと同等の性能を達成した。
  • 分離されたデコーダーとレグレッサーの使用により、収束が早まり、長時間の事前学習の必要性が低下した。
  • RGB差分は、オプティカルフローなどより複雑な運動表現よりも、この設定で単純ながらも効果的な運動予測ターゲットであることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。