Skip to main content
QUICK REVIEW

[論文レビュー] MARLIN: Masked Autoencoder for facial video Representation LearnINg

Zhixi Cai, Shreya Ghosh|arXiv (Cornell University)|Nov 12, 2022
Face recognition and analysis被引用数 4
ひとこと要約

MARLIN は、非アノテートのウェブクロールド動画から普遍的な顔面動画表現を学ぶ自己教師ありマスクドオートエンコーダを提案する。空間的・時間的詳細を密にマスクされた顔面領域から再構築するために顔面部品ガイドドチューブマスキング戦略(Fasking)を用いることで、顔の属性認識で1.13%の高い正確性、唇同期のFrechet Inception Distanceで29.36%の向上を達成し、複数の下流タスクで最先端の性能向上を実現した。

ABSTRACT

This paper proposes a self-supervised approach to learn universal facial representations from videos, that can transfer across a variety of facial analysis tasks such as Facial Attribute Recognition (FAR), Facial Expression Recognition (FER), DeepFake Detection (DFD), and Lip Synchronization (LS). Our proposed framework, named MARLIN, is a facial video masked autoencoder, that learns highly robust and generic facial embeddings from abundantly available non-annotated web crawled facial videos. As a challenging auxiliary task, MARLIN reconstructs the spatio-temporal details of the face from the densely masked facial regions which mainly include eyes, nose, mouth, lips, and skin to capture local and global aspects that in turn help in encoding generic and transferable features. Through a variety of experiments on diverse downstream tasks, we demonstrate MARLIN to be an excellent facial video encoder as well as feature extractor, that performs consistently well across a variety of downstream tasks including FAR (1.13% gain over supervised benchmark), FER (2.64% gain over unsupervised benchmark), DFD (1.86% gain over unsupervised benchmark), LS (29.36% gain for Frechet Inception Distance), and even in low data regime. Our code and models are available at https://github.com/ControlNet/MARLIN .

研究の動機と目的

  • タスクに依存しない普遍的な顔面動画エンコーダを構築し、タスク固有のアノテーションを必要とせずに多様な顔面分析タスクに一般化すること。
  • 顔面分析におけるデータ不足とアノテーションコストの制限を克服するため、豊富に存在する非アノテート顔面動画を活用して自己教師あり事前学習を行うこと。
  • 局所的(例:目、口)および全体的な顔面ダイナミクスを捉える挑戦的な再構築タスクを定式化することで、特徴の転送可能性を向上させること。
  • 敵対的訓練と、標準的なマスキング手法を凌駕する新しい顔面領域ガイドドマスキング戦略(Fasking)を用いて、表現品質を向上させること。
  • 大規模でキュレーションされていない動画データからロバストで汎用的な顔面特徴を学習することで、少データ・低データ環境下でも効果的な性能を実現すること。

提案手法

  • ViTベースのエンコーダとデコーダを用い、密にマスクされた顔面領域から空間的・時間的顔面動画フレームを再構築するマスクドオートエンコーダフレームワーク(MARLIN)を提案する。
  • 顔面ランドマークをFaceXZooを用いて動的に追跡し、目、鼻、口、唇、皮膚などの重要な顔面部位をマスクすることで、局所的および全体的な顔面構造の学習を促進する、新しい顔面ガイドドチューブマスキング戦略(Fasking)を導入する。
  • 再構築の難易度と特徴品質のバランスを図るため、約90%のマスキング比を採用し、CMU-MOSEIおよびFF++データセットを用いて実証的に検証した。
  • 潜在表現に敵対的訓練を組み込み、再構築の忠実度を向上させ、学習された特徴の品質を向上させる。
  • デフォルトのエンコーダとしてViT-Bを採用し、性能とスケーラビリティを比較するためのアブレーションスタディでViT-S、ViT-B、ViT-Lを検証した。
  • マスクドオートエンコーディング目的に基づき、YouTube Facesデータセットで事前学習を行い、その後、最小限のラベル付きデータで下流タスクに微調整した。
Figure 1 : Overview of the proposed Masked Autoencoder for facial Representation LearnINg aka MARLIN. MARLIN aims to learn a universal facial representation from abundantly available non-annotated facial video data.
Figure 1 : Overview of the proposed Masked Autoencoder for facial Representation LearnINg aka MARLIN. MARLIN aims to learn a universal facial representation from abundantly available non-annotated facial video data.

実験結果

リサーチクエスチョン

  • RQ1自己教師ありマスクドオートエンコーダは、キュレーションされておらずアノテートされていない顔面動画から汎用的かつ転送可能な顔面表現を学習できるか?
  • RQ2顔面部品ガイドドマスキング戦略(Fasking)は、ランダムマスキング、フレームレベルマスキング、または標準的なチューブマスキングに比べて、顔面動画表現学習においてより優れた特徴学習をもたらすか?
  • RQ3敵対的訓練は、顔面特徴の再構築品質と顔面分析タスクの下流性能をどのように向上させるか?
  • RQ4MARLIN は、ラベル付きデータが限られたタスクを含め、多様な顔面分析タスクにどの程度一般化できるか?
  • RQ5顔面動画マスクドオートエンコーディングにおいて、再構築の難易度と特徴品質のバランスを取る最適なマスキング比は何か?

主な発見

  • 顔の属性認識(FAR)において、教師ありベンチマークを1.13%の絶対的な正確性向上で上回り、限られたラベル付きデータでも強力な転送性を示した。
  • 顔の表情認識(FER)では、自己教師ありベンチマークを2.64%上回る性能を達成し、感情に敏感な表現の学習効果が顕著に現れた。
  • DeepFake検出(DFD)では、自己教師ありベースラインを1.86%上回り、微細な顔面操作パターンに対してもロバストであることを示した。
  • 唇同期(LS)では、ベースライン手法と比較してFrechet Inception Distance(FID)を29.36%改善し、空間的・時間的顔面運動の生成品質が優れていることを示した。
  • アブレーションスタディにより、Faskingマスキング戦略がランダム、フレームレベル、標準的なチューブマスキングを上回り、すべての下流タスクで最高の性能を達成した。
  • 最適なマスキング比は実証的に約90%であると判明した。これは、マスキング比が低すぎると可視情報が多すぎ、高すぎると再構築の難易度が高くなり、両者とも性能が低下するためである。
Figure 2 : Architectural overview of MARLIN (Best viewed in color). MARLIN mainly consists of (a) Representation Learning Module, (b) Facial Region guided Tube Masking, and (c) Downstream Adaptation. (a) Representation Learning Module: MARLIN learns the facial representation from the unlabeled, web
Figure 2 : Architectural overview of MARLIN (Best viewed in color). MARLIN mainly consists of (a) Representation Learning Module, (b) Facial Region guided Tube Masking, and (c) Downstream Adaptation. (a) Representation Learning Module: MARLIN learns the facial representation from the unlabeled, web

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。