Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer

Anwei Luo, Rizhao Cai|arXiv (Cornell University)|2023. 09. 20.
Face recognition and analysisComputer Science인용 수 3
한 줄 요약

이 논문은 전이 학습된 비전 트랜스포머(ViT) 지식을 유지하면서 도금 특성에 적응하기 위한 매개변수 효율적인 방법인 위조 인지 적응형 비전 트랜스포머(FA-ViT)를 제안한다. 두 모듈을 통해 이루어지며, 국소적 아티팩트 탐지를 위한 이웃 보존 교차 attention(NPCA)를 갖는 국소 인지 위조 주입기(LFI)와 전역 도메인 적응을 위한 전역 인지 위조 적응기(GFA)이다. FA-ViT는 교차 데이터셋 및 교차 조작 일반화에서 최고 성능을 기록하였으며, FaceForensics++에서 99.60% AUC, Celeb-DF에서 93.83% AUC를 달성하였다.

ABSTRACT

With the rapid progress of generative models, the current challenge in face forgery detection is how to effectively detect realistic manipulated faces from different unseen domains. Though previous studies show that pre-trained Vision Transformer (ViT) based models can achieve some promising results after fully fine-tuning on the Deepfake dataset, their generalization performances are still unsatisfactory. One possible reason is that fully fine-tuned ViT-based models may disrupt the pre-trained features [1, 2] and overfit to some data-specific patterns [3]. To alleviate this issue, we present a extbf{F}orgery-aware extbf{A}daptive extbf{Vi}sion extbf{T}ransformer (FA-ViT) under the adaptive learning paradigm, where the parameters in the pre-trained ViT are kept fixed while the designed adaptive modules are optimized to capture forgery features. Specifically, a global adaptive module is designed to model long-range interactions among input tokens, which takes advantage of self-attention mechanism to mine global forgery clues. To further explore essential local forgery clues, a local adaptive module is proposed to expose local inconsistencies by enhancing the local contextual association. In addition, we introduce a fine-grained adaptive learning module that emphasizes the common compact representation of genuine faces through relationship learning in fine-grained pairs, driving these proposed adaptive modules to be aware of fine-grained forgery-aware information. Extensive experiments demonstrate that our FA-ViT achieves state-of-the-arts results in the cross-dataset evaluation, and enhances the robustness against unseen perturbations. Particularly, FA-ViT achieves 93.83\% and 78.32\% AUC scores on Celeb-DF and DFDC datasets in the cross-dataset evaluation. The code and trained model have been released at: https://github.com/LoveSiameseCat/FAViT.

연구 동기 및 목표

  • 제한된 딥페이크 데이터에서의 치명적 잊음과 과적합으로 인해 ViT 기반의 얼굴 위조 탐지기의 일반화 능력이 떨어지는 문제를 해결한다.
  • 모든 전이 학습된 ViT 매개변수를 동결하여 일반 시각적 표현을 유지하면서, 매개변수 효율적 적응을 통해 위조 특성 지식을 통합한다.
  • 적응형 특징 학습을 통해 미리 보지 않은 조작 유형과 도전적인 조건(예: 큰 자세, 낮은 조명)에 대한 탐지 강건성을 향상시킨다.
  • 새로운 단일 도메인 쌍별 학습(SDPL) 전략을 통해 진짜 얼굴 특징 분포를 압축하여 세밀한 특징 학습 능력을 향상시킨다.
  • 이미지넷 수준의 분류와 세밀한 위조 탐지 사이의 도메인 갭을 전역 및 국소 위조 인지 적응을 통해 메우는 것을 목표로 한다.

제안 방법

  • 전이 학습된 ViT의 모든 매개변수를 동결하여 일반적인 시각적 표현을 유지하고 치명적 잊음을 방지한다.
  • 국소 위조 아티팩트를 캡처하기 위해 컨volutional 인덕티브 바이어스를 갖는 국소 인지 위조 주입기(LFI)를 도입하고, 이는 이웃 보존 교차 attention(NPCA)를 통해 ViT에 주입한다.
  • 멀티헤드 자기주의(MHSA) 레이어에서 적응형 변환을 학습하기 위해 전역 인지 위조 적응기(GFA)를 설계하여 전이 학습된 특징과 위조 관련 표현을 정렬한다.
  • LFI와 GFA에 신뢰성 있는 매핑 초기화를 구현하여 학습 안정성을 확보하고, 초기 출력이 근처 0에 가까워지도록 한다.
  • 실제 얼굴 쌍을 구성하는 단일 도메인 쌍별 학습(SDPL) 전략을 제안한다. 이는 배경과 자세는 동일하지만 신원이 다른 실물 얼굴 쌍을 구성하며, 실물 클래스 분류기 벡터를 앵커로 사용하여 특징의 압축성을 향상시킨다.
  • Grad-CAM++를 사용하여 주의 맵을 시각화하고, FA-ViT가 중심 얼굴 영역이 아닌 실제 조작 영역(예: 입, 눈)에 집중하고 있음을 검증한다.

실험 결과

연구 질문

  • RQ1전체 모델을 미세조정하지 않고도, 새로운 데이터셋과 조작 유형에 대해 ViT 기반 얼굴 위조 탐지기의 일반화 능력을 향상시킬 수 있는가?
  • RQ2일반 표현 능력을 유지하면서 전이 학습된 ViT에 국소 위조 신호를 효과적으로 주입할 수 있는가?
  • RQ3자기주의 레이어에서의 전역 적응적 적응이 이미지넷 분류와 위조 탐지 사이의 도메인 갭을 어느 정도 메울 수 있는가?
  • RQ4세밀한 실물 얼굴 유사성을 강조하는 새로운 쌍별 학습 전략이 특징의 압축성과 탐지 강건성을 향상시키는가?
  • RQ5큰 자세나 낮은 조명과 같은 도전적인 조건에서도 제안된 FA-ViT가 조작 영역에 높은 주의를 유지할 수 있는가?

주요 결과

  • FA-ViT는 FaceForensics++(FF++)에서 99.60% AUC를 기록하여 다음으로 우수한 변종보다 0.06% 높은 성능을 보이며 교차 데이터셋 평가에서 최고 성능을 기록하였다.
  • Celeb-DF(CDF) 데이터셋에서 FA-ViT는 93.83% AUC를 달성하였으며, 신원 매핑 초기화가 없는 변종(91.38%)과 기본 ViT보다도 뚜렷한 향상을 보였다.
  • Wild-Deepfake(WDF) 데이터셋에서 FA-ViT는 84.32% AUC를 기록하여 새로운 조작 방법에 대한 강력한 일반화 능력을 보였다.
  • t-SNE 시각화 결과 FA-ViT가 다양한 데이터셋에서 진짜 얼굴의 밀집 클러스터링을 유지함을 확인하여 강력하고 일반화된 특징 학습 능력을 입증하였다.
  • Grad-CAM++ 시각화 결과 FA-ViT는 항상 조작 특성 영역(예: Face2Face의 경우 입, Deepfakes의 경우 눈)에 집중하는 반면, ViT는 이러한 아티팩트를 국소화하지 못하는 것으로 나타났다.
  • 제거 실험 결과 LFI와 GFA에서 신원 매핑 초기화가 필수적임을 확인하였으며, 이를 제거하면 CDF에서 최대 2.5% 성능 저하가 발생하여 학습 안정성과 특징 일관성 유지를 위한 역할임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.