Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Video Representation Learning with Motion-Aware Masked Autoencoders

Haosen Yang, Huang Deng|arXiv (Cornell University)|Oct 9, 2022
Generative Adversarial Networks and Image Synthesis被引用数 9
ひとこと要約

本稿では、時間的差分に基づく隣接フレーム間の動き構造とマスクされた動画フレームパッチの両方を同時に再構築することで、自己教師あり動画表現学習を向上させるMotionMAEを提案する。静的外観と動的動きの両方をモデル化することにより、MotionMAEは最先端の性能を達成し、ドメイン固有の事前学習条件下でSomething-Something V2で1.2%、UCF101で3.2%の上回りを記録。また、動画オブジェクトセグメンテーションにおいては3%以上の向上を達成した。

ABSTRACT

Masked autoencoders (MAEs) have emerged recently as art self-supervised spatiotemporal representation learners. Inheriting from the image counterparts, however, existing video MAEs still focus largely on static appearance learning whilst are limited in learning dynamic temporal information hence less effective for video downstream tasks. To resolve this drawback, in this work we present a motion-aware variant -- MotionMAE. Apart from learning to reconstruct individual masked patches of video frames, our model is designed to additionally predict the corresponding motion structure information over time. This motion information is available at the temporal difference of nearby frames. As a result, our model can extract effectively both static appearance and dynamic motion spontaneously, leading to superior spatiotemporal representation learning capability. Extensive experiments show that our MotionMAE outperforms significantly both supervised learning baseline and state-of-the-art MAE alternatives, under both domain-specific and domain-generic pretraining-then-finetuning settings. In particular, when using ViT-B as the backbone our MotionMAE surpasses the prior art model by a margin of 1.2% on Something-Something V2 and 3.2% on UCF101 in domain-specific pretraining setting. Encouragingly, it also surpasses the competing MAEs by a large margin of over 3% on the challenging video object segmentation task. The code is available at https://github.com/happy-hsy/MotionMAE.

研究の動機と目的

  • 既存のマスク付き自己オートエンコーダーが静的外観に偏り、時間的ダイナミクスを十分に活用していないという限界を是正すること。
  • 空間的・時間的表現学習を向上させるために、動き構造を追加の再構築ターゲットとして明示的にモデル化すること。
  • 特に動きに敏感なタスク、たとえばアクション認識や動画オブジェクトセグメンテーションなど、下流の動画理解タスクにおける性能を向上させること。
  • ドメイン固有およびドメイン一般的な事前学習設定の両方で、動きに配慮した再構築の有効性を検証すること。

提案手法

  • MotionMAEは非対称なトランスフォーマー基盤アーキテクチャを採用し、エンコーダーは可視パッチのみを処理し、デコーダーはマスクされたパッチを含むすべてのパッチを再構築する。
  • モデルは、マスクされた個々のフレームパッチ(外観用)と、隣接フレーム間の時間的差分(動き構造用)の両方を再構築することを学習する。
  • 動き構造は、2つの連続フレーム間の差分として計算され、動きダイナミクスの自然で内生的な表現を提供する。
  • 再構築損失はフレームと動きの両方のターゲットを組み合わせており、マルチタスク目的関数を用いてエンドツーエンドで学習される。
  • デコーダーは十分な幅と深さを備えており、空間的および時間的情報を効果的に再構築できるように設計されており、アブレーションスタディにより最適な容量が特定された。
  • 標準的なデータ拡張およびマスキング戦略が採用されており、トレーニング中に1フレームあたり90%のパッチがマスクされる。

実験結果

リサーチクエスチョン

  • RQ1フレーム外観と動き構造の両方を同時に再構築することは、自己教師あり動画表現学習を向上させ得るか?
  • RQ2マスク付き自己オートエンコーダーにおいて、フレーム再構築に加えて時間的差分による動きモデリングを行うと、単独のフレーム再構築に比べてどのように差がつくか?
  • RQ3動きモデリングの導入により、特に動きに敏感なタスクにおける一般化性能が向上するか?
  • RQ4動きに配慮したMAEにおける、再構築ターゲット、損失関数、デコーダー構造の最適設計は何か?

主な発見

  • ドメイン固有の事前学習条件下で、Something-Something V2では75.5%のトップ1正解率を達成し、先行研究を1.2%上回った。
  • UCF101では94.0%の正解率を記録し、最も強力な競合するMAEモデルを3.2%上回った。
  • 挑戦的なDAVIS2017動画オブジェクトセグメンテーションベンチマークでは、競合するMAEモデルを3%以上上回る平均IOUを達成した。
  • アブレーションスタディにより、フレームと動きの再構築を組み合わせることが最良の性能をもたらすことが確認され、最も細分化された動き(隣接フレーム差分)が最も効果的であることが示された。
  • MSE損失関数が最も優れた結果をもたらし、デコーダーには十分な幅(384)と深さ(4)が必要であることが判明した。
  • 可視化により、MotionMAEが新しいサンプルにうまく一般化できており、95%のマスキング比であっても、外観と動きの両方の再構築品質が高く維持されていることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。