Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Vision Transformer and Masked Autoencoder in Multimodal Face Anti-Spoofing

Zitong Yu, Rizhao Cai|arXiv (Cornell University)|2023. 02. 11.
Biometric Identification and Security인용 수 4
한 줄 요약

이 논문은 다중모odal 얼굴 위조 방지(FAS)를 위한 비전 트랜스포머(ViT)와 마스크드 오토인코더(MAE)를 재고하며, 모odal별 입력, 자기지도 학습을 위한 모달리티 비대칭 마스크드 오토인코더(M²A²E), 그리고 효율적인 미세조정을 위한 적응형 다중모달 어댑터(AMA)를 도입한다. 제안된 방법은 단일모달 및 다중모달 FAS 벤치마크에서 최고 성능을 달성하며, RGB, IR 및 깊이 모달에서 뛰어난 일반화 및 강건성을 입증한다.

ABSTRACT

Recently, vision transformer (ViT) based multimodal learning methods have been proposed to improve the robustness of face anti-spoofing (FAS) systems. However, there are still no works to explore the fundamental natures ( extit{e.g.}, modality-aware inputs, suitable multimodal pre-training, and efficient finetuning) in vanilla ViT for multimodal FAS. In this paper, we investigate three key factors (i.e., inputs, pre-training, and finetuning) in ViT for multimodal FAS with RGB, Infrared (IR), and Depth. First, in terms of the ViT inputs, we find that leveraging local feature descriptors benefits the ViT on IR modality but not RGB or Depth modalities. Second, in observation of the inefficiency on direct finetuning the whole or partial ViT, we design an adaptive multimodal adapter (AMA), which can efficiently aggregate local multimodal features while freezing majority of ViT parameters. Finally, in consideration of the task (FAS vs. generic object classification) and modality (multimodal vs. unimodal) gaps, ImageNet pre-trained models might be sub-optimal for the multimodal FAS task. To bridge these gaps, we propose the modality-asymmetric masked autoencoder (M$^{2}$A$^{2}$E) for multimodal FAS self-supervised pre-training without costly annotated labels. Compared with the previous modality-symmetric autoencoder, the proposed M$^{2}$A$^{2}$E is able to learn more intrinsic task-aware representation and compatible with modality-agnostic (e.g., unimodal, bimodal, and trimodal) downstream settings. Extensive experiments with both unimodal (RGB, Depth, IR) and multimodal (RGB+Depth, RGB+IR, Depth+IR, RGB+Depth+IR) settings conducted on multimodal FAS benchmarks demonstrate the superior performance of the proposed methods. We hope these findings and solutions can facilitate the future research for ViT-based multimodal FAS.

연구 동기 및 목표

  • 비전 트랜스포머(ViT)를 다중모달 얼굴 위조 방지(FAS)에 적용할 때 발생하는 근본적 과제, 즉 모달리티 인지 입력, 적절한 사전학습, 효율적인 미세조정을 탐구한다.
  • 특히 적외선(IR) 모달에서의 모달리티 특화 표현을 다루는 데 어려움을 겪는 순수 ViT의 한계를 국소적 특징 기술자들을 통합함으로써 해결한다.
  • ImageNet 사전학습이 FAS에 대해 최적화되지 않은 점을 보완하기 위해, 작업에 특화된 자기지도 학습을 위한 모달리티 비대칭 마스크드 오토인코더(M²A²E)를 설계한다.
  • 대부분의 ViT 파rameter를 동결하면서도 다중모달 특징을 융합할 수 있는 적응형 다중모달 어댑터(AMA)를 통해 ViT의 다중모달 FAS에서의 효율적이고 효과적인 미세조정을 가능하게 한다.

제안 방법

  • 모달리티별 입력 처리 방식 도입: RGB 및 깊이 모달에는 원본 입력을 사용하고, IR 모달에는 국소적 특징 기술자(HOG, PLGF 등)를 사용하여 국소적이고 조명에 강인한 표현을 향상시킨다.
  • 다양한 모달 간에 비대칭적으로 마스크하고 복원하는 모달리티 비대칭 마스크드 오토인코더(M²A²E)를 제안하여, 레이블이 없는 데이터에서 작업 인지된 일반화된 표현 학습을 가능하게 한다.
  • 대부분의 ViT 파rameter를 동결하면서도 국소적 다중모달 특징을 효율적으로 융합하는 적응형 다중모달 어댑터(AMA)를 설계하여, 파라미터 효율적인 미세조정을 실현한다.
  • 다단계 학습 전략을 적용: 먼저 M²A²E를 레이블이 없는 데이터에서 사전학습하고, 이후 AMA를 사용하여 다운스트림 FAS 작업에서 미세조정함으로써 자기지도 학습 및 지도 학습 신호를 모두 활용한다.
  • M²A²E에서 계층적 마스크 전략을 도입하여, 다양한 모달 간에 다른 비율로 마스크하고 모달리티에 맞는 디코더로 복원함으로써 작업에 관련된 신호를 유지한다.
  • 다양한 벤치마크(WMCA, CeFA)에서 본래의 공격 프로토콜과 새로운 공격 프로토콜 모두에 대해 단일모달 및 다중모달 설정(RGB+IR+Depth 등)을 평가하여 방법을 검증한다.

실험 결과

연구 질문

  • RQ1ViT 입력에 국소적 특징 기술자(HOG, PLGF 등)를 통합하면 다중모달 FAS에서 적외선(IR) 모달의 성능 향상에 기여하는가?
  • RQ2모달리티 비대칭 마스크드 오토인코더(M²A²E)는 대칭적 MAE 및 ImageNet 사전학습보다 다중모달 FAS에서 자기지도 사전학습에 더 나은 성능을 보일 수 있는가?
  • RQ3적응형 다중모달 어댑터(AMA)는 단일모달 및 다중모달 설정에서 ViT의 효율적인 미세조정을 얼마나 효과적으로 가능하게 하는가?
  • RQ4모달리티 인지 입력, M²A²E 사전학습, AMA 미세조정의 조합이 새로운 공격 및 배포 조건에서 뛰어난 일반화 성능을 달성하는가?

주요 결과

  • IR 모달 입력에 국소적 특징 기술자(HOG, PLGF 등)를 사용하면, 특히 双모달 및 삼모달 설정에서 국소적이고 조명에 강인한 특징 표현이 향상되어 ViT 성능이 크게 향상된다.
  • 제안된 모달리티 비대칭 마스크드 오토인코더(M²A²E)는 모든 단일모달 및 다중모달 FAS 설정에서 대칭적 다중모달 MAE 및 ImageNet 사전학습을 모두 초월하며, 우수한 최종 성능 일반화 능력을 입증한다.
  • 적응형 다중모달 어댑터(AMA)는 최소한의 파라미터 업데이트로 효율적인 미세조정을 가능하게 하여 대부분의 ViT 레이어를 동결함으로써, 작은 FAS 데이터셋에서의 과적합 위험을 줄인다.
  • WMCA 벤치마크에서 '본 적 있는' 공격 프로토콜 하에서, 전체 파이프라인(M²A²E 사전학습 + AMA 미세조정 + 모달리티 인지 입력)이 RGB+IR+Depth에서 100% EER를 달성하여 기존 방법을 능가한다.
  • M²A²E 복원 결과의 시각화를 통해, 마스크된 입력에서도 살아있는 얼굴/위조 신호(예: 얼굴 깊이, 질감)를 유지함을 확인하여, 모델이 구분 가능한 작업 인지 표현을 효과적으로 학습할 수 있음을 검증한다.
  • 제거 실험 결과, 마지막 트랜스포머 블록과 분류 헤드만 미세조정하는 것이 성능과 효율성의 최적 균형을 이룹니다. 이는 전체 미세조정보다 과적합이 줄어들어 더 나은 성능을 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.