[논문 리뷰] FM-ViT: Flexible Modal Vision Transformers for Face Anti-Spoofing
FM-ViT는 다중 모odal 훈련 데이터를 사용하여 유연한 단일 모odal 추론을 가능하게 하는 순수한 Vision Transformer 기반의 얼굴 위조 방지 프레임워크를 제안한다. 다중 헤드 상호 주의(Multi-headed Mutual-Attention)와 융합 주의(Fusion-Attention)를 갖춘 교차 모달 트랜스포머 블록(Cross-Modal Transformer Block, CMTB)을 도입함으로써, 모달 특화 특징 학습을 향상시키고 모달 간 불변의 생존 신호를 추출하여, 다중 모달 기반 모델보다 낮은 FLOPs와 파라미터로 최신 성능을 달성한다.
The availability of handy multi-modal (i.e., RGB-D) sensors has brought about a surge of face anti-spoofing research. However, the current multi-modal face presentation attack detection (PAD) has two defects: (1) The framework based on multi-modal fusion requires providing modalities consistent with the training input, which seriously limits the deployment scenario. (2) The performance of ConvNet-based model on high fidelity datasets is increasingly limited. In this work, we present a pure transformer-based framework, dubbed the Flexible Modal Vision Transformer (FM-ViT), for face anti-spoofing to flexibly target any single-modal (i.e., RGB) attack scenarios with the help of available multi-modal data. Specifically, FM-ViT retains a specific branch for each modality to capture different modal information and introduces the Cross-Modal Transformer Block (CMTB), which consists of two cascaded attentions named Multi-headed Mutual-Attention (MMA) and Fusion-Attention (MFA) to guide each modal branch to mine potential features from informative patch tokens, and to learn modality-agnostic liveness features by enriching the modal information of own CLS token, respectively. Experiments demonstrate that the single model trained based on FM-ViT can not only flexibly evaluate different modal samples, but also outperforms existing single-modal frameworks by a large margin, and approaches the multi-modal frameworks introduced with smaller FLOPs and model parameters.
연구 동기 및 목표
- 훈련 입력과 다를 경우 테스트 모달이 다른 경우 실패하는 다중 모달 얼굴 위조 방지 모델의 한계를 해결하기 위해.
- 일관된 모달이 필요 없이 가용한 다중 모달 데이터를 활용해 단일 모달 얼굴 위조 방지 성능을 향상시키기 위해.
- CNN보다 장거리 의존성과 전반적인 위조 신호를 더 효과적으로 포착할 수 있는 순수한 트랜스포머 기반 아키텍처를 개발하기 위해.
- 교차 모달 주의 메커니즘을 통해 모달 간 불변의 특징 학습을 가능하게 하여 클래스 토큰 표현을 풍부하게 하기 위해.
제안 방법
- FM-ViT는 각 입력 모달(예: RGB, Depth, IR)에 대해 하나의 브랜치를 갖는 다중 브랜치 Vision Transformer 아키텍처를 사용하여 독립적으로 모달 특화 특징을 학습한다.
- 교차 모달 트랜스포머 블록(Cross-Modal Transformer Block, CMTB)은 ViT 인코더의 특정 스테이지 이후에 삽입되어 교차 모달 특징 상호작용을 가능하게 한다.
- CMTB는 두 개의 연결된 주의 모듈로 구성된다: 다중 헤드 상호 주의(Multi-headed Mutual-Attention, MMA)는 한 모달의 주의 맵을 사용해 다른 모달의 정보적인 패치 토큰을 식별하고, 융합 주의(Fusion-Attention, MFA)는 다른 모달의 패치 토큰과의 교차 주의를 통해 CLS 토큰에 교차 모달 정보를 강화한다.
- MMA는 상위 50%의 주의 질량을 유지하기 위해 학습 가능한 임계값 함수 Γλ(⋅)를 사용하여, 다양한 모달 간 선택적 특징 채굴을 보장한다.
- MFA는 한 모달의 CLS 토큰과 다른 모달의 패치 토큰 간 교차 주의를 수행하여, 모달 간 불변의 생존 표현을 학습할 수 있도록 한다.
- 이 프레임워크는 다중 모달 데이터로 훈련되지만, 어떤 단일 모달에서도 추론에 사용될 수 있어, 다양한 모달 테스트를 유연하게 지원한다.
실험 결과
연구 질문
- RQ1다중 모달 데이터로 훈련된 단일 모델이 추론 시 일관된 모달이 없더라도 단일 모달 테스트 시나리오로 효과적으로 일반화될 수 있는가?
- RQ2교차 모달 주의 메커니즘은 단일 모달 입력에서 미세한 위조 흔적을 어떻게 향상시킬 수 있는가?
- RQ3순수한 트랜스포머 기반 FAS 프레임워크에서 모달 특화 특징 학습과 모달 간 불변 표현 학습 사이의 최적의 균형은 무엇인가?
- RQ4경량 트랜스포머 모듈은 다중 모달 융합 기반 모델 대비 FLOPs와 모델 파라미터를 줄이며 성능을 얼마나 향상시킬 수 있는가?
주요 결과
- FM-ViT(S) 버전은 OULU-NPU 데이터셋의 R/D/I 프로토콜에서 각각 2.87%/2.32%/2.13%의 ACER를 기록하여 기준 ViT(S)보다 평균 1.45%포인트 우수하다.
- FM-ViT(S)는 전체 다중 모달 FM-ViT(B) 대비 FLOPs를 90% 감소시키고 파라미터를 91% 감소시키면서도 뛰어난 성능을 유지한다.
- 제거 실험 결과, MMA 임계값 함수에서 λ=0.5가 최적의 성능을 내며, 정보성 토큰 선택과 특징 다양성 간의 균형을 잘 맞춘다.
- 시각화 결과, MMA는 목표 모달이 이러한 신호를 놓쳤더라도 종이 가장자리나 안경과 같은 위조 관련 영역으로 주의를 효과적으로 이동시킨다.
- MFA는 다양한 모달 간 특징 관련성 지ap을 향상시켜 주목할 만한 특징의 반응 영역을 확장하고 미세한 위조 아티팩트에 대한 강건성을 향상시킨다.
- 다양한 벤치마크, 즉 OULU-NPU, WMCA, MmFa에서 최신 성능을 달성하며, 예상치 못한 프로토콜에 대해서도 강력한 제로샷 일반화 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.