Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Vision Transformer and Masked Autoencoder in Multimodal Face Anti-Spoofing

Zitong Yu, Rizhao Cai|arXiv (Cornell University)|Feb 11, 2023
Biometric Identification and Security被引用数 4
ひとこと要約

本稿は、マルチモーダルな顔偽造検出(FAS)のため、ビジョントランスフォーマー(ViT)とマスクドオートエンコーダー(MAE)を再考し、モダリティに適した入力、自己教師あり事前学習のためのモダリティ非対称なマスクドオートエンコーダー(M²A²E)、および効率的な微調整のためのアダプティブマルチモーダルアダプタ(AMA)を導入する。提案手法は、RGB、赤外線(IR)、深度モダリティにおいて、ユニモーダルおよびマルチモーダルなFASベンチマークで最先端の性能を達成し、一般化性能と耐障害性に優れていることを示している。

ABSTRACT

Recently, vision transformer (ViT) based multimodal learning methods have been proposed to improve the robustness of face anti-spoofing (FAS) systems. However, there are still no works to explore the fundamental natures ( extit{e.g.}, modality-aware inputs, suitable multimodal pre-training, and efficient finetuning) in vanilla ViT for multimodal FAS. In this paper, we investigate three key factors (i.e., inputs, pre-training, and finetuning) in ViT for multimodal FAS with RGB, Infrared (IR), and Depth. First, in terms of the ViT inputs, we find that leveraging local feature descriptors benefits the ViT on IR modality but not RGB or Depth modalities. Second, in observation of the inefficiency on direct finetuning the whole or partial ViT, we design an adaptive multimodal adapter (AMA), which can efficiently aggregate local multimodal features while freezing majority of ViT parameters. Finally, in consideration of the task (FAS vs. generic object classification) and modality (multimodal vs. unimodal) gaps, ImageNet pre-trained models might be sub-optimal for the multimodal FAS task. To bridge these gaps, we propose the modality-asymmetric masked autoencoder (M$^{2}$A$^{2}$E) for multimodal FAS self-supervised pre-training without costly annotated labels. Compared with the previous modality-symmetric autoencoder, the proposed M$^{2}$A$^{2}$E is able to learn more intrinsic task-aware representation and compatible with modality-agnostic (e.g., unimodal, bimodal, and trimodal) downstream settings. Extensive experiments with both unimodal (RGB, Depth, IR) and multimodal (RGB+Depth, RGB+IR, Depth+IR, RGB+Depth+IR) settings conducted on multimodal FAS benchmarks demonstrate the superior performance of the proposed methods. We hope these findings and solutions can facilitate the future research for ViT-based multimodal FAS.

研究の動機と目的

  • ビジョントランスフォーマー(ViT)をマルチモーダルな顔偽造検出(FAS)に適用する際の根本的課題、すなわちモダリティに適した入力、適切な事前学習、および効率的な微調整を調査すること。
  • 特に赤外線(IR)モダリティにおける特徴表現の特異性に対応するため、ローカル特徴記述子を組み込むことで、アンマスクドViTの限界を克服すること。
  • FASに最適化されていないImageNet事前学習の非最適性を解消するため、タスク固有の自己教師あり事前学習のためのモダリティ非対称なマスクドオートエンコーダー(M²A²E)を設計すること。
  • ViTのマルチモーダルFASにおける効率的かつ効果的な微調整を可能にするアダプティブマルチモーダルアダプタ(AMA)を提供し、ViTの大部分のパラメータを固定しながらクロスマルチモーダル特徴を統合すること。

提案手法

  • モダリティ固有の入力処理を導入:RGBおよび深度モダリティには生の入力を使用する一方、赤外線(IR)モダリティにはローカル特徴記述子(例:HOG、PLGF)を用いることで、局所的かつ照度に頑健な表現を強化する。
  • 異なるモダリティ間でマスクと再構成を非対称的に行うモダリティ非対称なマスクドオートエンコーダー(M²A²E)を提案。これにより、ラベルなしデータを用いてタスクに適した一般化された表現学習が可能になる。
  • ローカルマルチモーダル特徴を効率的に統合するアダプティブマルチモーダルアダプタ(AMA)を設計。ViTの大部分のパラメータを固定することで、パラメータ効率的な微調整を実現する。
  • マルチステージトレーニング戦略を採用:まずM²A²Eをラベルなしデータで事前学習し、その後AMAを用いて下流のFASタスクで微調整。自己教師あり信号と教師あり信号の両方を活用する。
  • M²A²Eにおける階層的マスキング戦略を採用。異なるモダリティは異なる割合でマスクされ、モダリティ固有のデコーダーで再構成されることで、タスクに必要な手がかりを保持する。
  • 複数のベンチマーク(WMCA、CeFA)において、既知および未知の攻撃プロトコルの下で評価し、ユニモーダルおよびマルチモーダル設定(例:RGB+IR+Depth)を含む。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルFASにおける赤外線(IR)モダリティの性能向上に、ViT入力にローカル特徴記述子を組み込むことで効果があるか?
  • RQ2モダリティ非対称なマスクドオートエンコーダー(M²A²E)は、対称的MAEおよびImageNet事前学習を上回る自己教師あり事前学習性能を示すか?
  • RQ3アダプティブマルチモーダルアダプタ(AMA)は、ユニモーダルおよびマルチモーダル設定において、パラメータを最小限に抑えながらも効率的な微調整を可能にするか?
  • RQ4モダリティに適した入力、M²A²E事前学習、AMA微調整の組み合わせにより、未知の攻撃および展開環境において優れた一般化性能が得られるか?

主な発見

  • 赤外線モダリティの入力にローカル特徴記述子(例:HOG、PLGF)を用いることで、局所的かつ照度に頑健な特徴表現が向上し、特にバイモーダルおよびトライモーダル設定でViTの性能が顕著に向上する。
  • 提案されたモダリティ非対称なマスクドオートエンコーダー(M²A²E)は、すべてのユニモーダルおよびマルチモーダルFAS設定で、対称的マルチモーダルMAEおよびImageNet事前学習を上回り、優れた下流一般化性能を示している。
  • アダプティブマルチモーダルアダプタ(AMA)は、パラメータを最小限に更新することで効率的な微調整を実現し、ViTの大部分の層を固定することで、小規模なFASデータセットにおける過学習リスクを低減している。
  • WMCAベンチマークの「既知の攻撃」プロトコル下で、RGB+IR+Depthの全パイプライン(M²A²E事前学習+AMA微調整+モダリティに適した入力)は100%のEERを達成し、先行手法を上回っている。
  • M²A²Eの再構成結果の可視化により、マスクされた入力からでも、顔の奥行きやテクスチャといった重要なライブ/スプーフの手がかりを保持していることが確認され、モデルが判別可能なタスクに適した表現を学習していることが裏付けられた。
  • アブレーションスタディの結果、最後のトランスフォーマーブロックと分類ヘッドのみを微調整する戦略が、パフォーマンスと効率の最良のトレードオフを実現しており、全層微調整を上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。