[논문 리뷰] Deepfake Video Detection Using Generative Convolutional Vision Transformer
이 논문은 시각적 특징 추출에 ConvNeXt와 Swin Transformer를 결합하고 잠재 데이터 분포를 모델링하기 위해 오토에인코더와 변분 오토에인코더를 사용하는 새로운 딥페이크 영상 검출 모델인 GenConViT을 제안한다. 이 모델은 여러 벤치마크에서 95.8% 평균 정확도와 99.3% AUC를 기록하여 다양한 딥페이크 영상 탐지에서 뛰어난 일반화 능력과 강건성을 입증한다.
Deepfakes have raised significant concerns due to their potential to spread false information and compromise digital media integrity. In this work, we propose a Generative Convolutional Vision Transformer (GenConViT) for deepfake video detection. Our model combines ConvNeXt and Swin Transformer models for feature extraction, and it utilizes Autoencoder and Variational Autoencoder to learn from the latent data distribution. By learning from the visual artifacts and latent data distribution, GenConViT achieves improved performance in detecting a wide range of deepfake videos. The model is trained and evaluated on DFDC, FF++, DeepfakeTIMIT, and Celeb-DF v2 datasets, achieving high classification accuracy, F1 scores, and AUC values. The proposed GenConViT model demonstrates robust performance in deepfake video detection, with an average accuracy of 95.8% and an AUC value of 99.3% across the tested datasets. Our proposed model addresses the challenge of generalizability in deepfake detection by leveraging visual and latent features and providing an effective solution for identifying a wide range of fake videos while preserving media integrity. The code for GenConViT is available at https://github.com/erprogs/GenConViT.
연구 동기 및 목표
- 다양한 영상 분포 간 딥페이크 검출의 일반화 능력을 향상시키는 데 기여한다.
- 기존 방법들이 시각적 잔여물에만 의존해 새로운 타입의 딥페이크에 실패하는 한계를 극복한다.
- 시각적 특징과 잠재 데이터 분포를 동시에 모델링하여 검출의 강건성을 향상시킨다.
- 영상 시퀀스의 국소적 및 전역적 시공간 패턴을 효과적으로 포착하는 통합 아키텍처를 개발한다.
- 실제 응용에서 디지털 미디어의 무결성을 유지하기 위한 신뢰할 수 있는 솔루션을 제공한다.
제안 방법
- 영상 프레임에서 계층적 국소적 및 전역적 시각적 특징을 추출하기 위해 ConvNeXt와 Swin Transformer를 통합한다.
- 진짜 영상의 잠재 데이터 분포를 학습하기 위해 오토에인코더(AE)와 변분 오토에인코더(VAE)를 활용한다.
- AE와 VAE의 재구성 출력을 원본 프레임과 비교하여 조작의 징후가 되는 이질성을 식별한다.
- AE와 VAE의 재구성 오차와 ConvNeXt 및 Swin Transformer에서 유도된 시각적 특징을 융합하여 최종 분류를 수행한다.
- 교차 엔트로피 손실을 사용하고 AdamW로 최적화하여 다수의 딥페이크 데이터셋에서 엔드 투 엔드 모델을 훈련한다.
- 모델의 일반화 능력을 향상시키고 과적합을 방지하기 위해 데이터 증강 및 클래스 균형 기법을 적용한다.

실험 결과
연구 질문
- RQ1시각적 특징 추출과 잠재 분포 모델링을 융합하면 딥페이크 검출의 일반화 능력이 향상되는가?
- RQ2DFDC, FF++, DeepfakeTIMIT 및 Celeb-DF(v2)와 같은 다양한 딥페이크 데이터셋에서 GenConViT의 성능은 어떠한가?
- RQ3시각적 잔여물과 내부 데이터 표현을 동시에 모델링하면 검출의 강건성이 얼마나 향상되는가?
- RQ4벤치마크 데이터셋에서 정확도, AUC 및 F1-스코어 측면에서 GenConViT는 최신 기술 대비 어떻게 비교되는가?
- RQ5생성 모델과 결합된 ConvNeXt와 Swin Transformer의 융합 아키텍처는 단독 아키텍처보다 더 높은 성능을 낼 수 있는가?
주요 결과
- GenConViT는 DFDC 데이터셋에서 98.5% 정확도와 99.9% AUC를 기록하여 이전 최고 성능 모델을 초월했다.
- FF++ 데이터셋에서 모델은 97.0% 정확도와 99.6% AUC를 달성했으며, F1-스코어는 97.1%로 다양한 딥페이크 유형에 대해 뛰어난 성능을 보였다.
- Celeb-DF(v2)에서도 높은 성능을 유지하여 F1-스코어 95.5%와 AUC 98.1%를 기록하여 복잡한 조작에 대한 강건성을 입증했다.
- 모든 테스트 데이터셋에서 평균 정확도 95.8%와 평균 AUC 99.3%를 확보하여 일반화 능력이 뛰어남을 확인했다.
- GenConViT(B)는 GenConViT(A)를 약간 뛰어넘었으며, FF++에서 AUC 99.6%와 F1-스코어 96.8%를 기록하여 아키텍처 개선의 효과를 입증했다.
- 모델의 성능은 모든 지표에서 뛰어나 AUC와 F1-스코어 측면에서 특히 뛰어난 분류 능력을 보이며 진짜 영상과 가짜 영상 간의 구분 능력이 뛰어나다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.