Skip to main content
QUICK REVIEW

[논문 리뷰] ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images

Binh M. Le, Simon S. Woo|arXiv (Cornell University)|2021. 12. 07.
Digital Media Forensic Detection인용 수 9
한 줄 요약

이 논문은 주어진 고품질 데이터로 훈련된 교사 모델에서 저품질(LQ) 압축 딥패이크 탐지에 적합한 고주파 및 상관 특징 표현을 학습자 모델로 이전하는 주파수 주의 분산 및 다중 시야 주의 분산을 활용하는 지식 정복 프레임워크 ADD를 제안한다. 이를 통해 ADD는 압축된 딥패이크 데이터셋에서 최대 7.1%의 정확도 향상을 기록하며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Despite significant advancements of deep learning-based forgery detectors for distinguishing manipulated deepfake images, most detection approaches suffer from moderate to significant performance degradation with low-quality compressed deepfake images. Because of the limited information in low-quality images, detecting low-quality deepfake remains an important challenge. In this work, we apply frequency domain learning and optimal transport theory in knowledge distillation (KD) to specifically improve the detection of low-quality compressed deepfake images. We explore transfer learning capability in KD to enable a student network to learn discriminative features from low-quality images effectively. In particular, we propose the Attention-based Deepfake detection Distiller (ADD), which consists of two novel distillations: 1) frequency attention distillation that effectively retrieves the removed high-frequency components in the student network, and 2) multi-view attention distillation that creates multiple attention vectors by slicing the teacher's and student's tensors under different views to transfer the teacher tensor's distribution to the student more efficiently. Our extensive experimental results demonstrate that our approach outperforms state-of-the-art baselines in detecting low-quality compressed deepfake images.

연구 동기 및 목표

  • 기존 딥패이크 탐지기에서 미세한 아티팩트 손실로 인해 성능이 떨어지는 저품질 압축 딥패이크 이미지를 탐지하는 데 있어 핵심 과제를 해결하기 위해.
  • 압축 이미지가 널리 보급된 대역폭 및 스토리지 제약 조건이 있는 환경에서 탐지 성능의 강건성을 향상시키기 위해.
  • 고품질(HQ) 교사 모델에서 유의미한 특징을 추출하여 저품질(LQ) 데이터로 훈련된 경량 학습자 모델로 이전하는 지식 정복(KD)을 활용하기 위해.
  • 특히 압축 과정에서 손실된 고주파 성분을 복구하고, 압축 이미지 내에서 픽셀 간 상관관계를 유지하기 위해 새로운 주의 메커니즘을 도입하기 위해.
  • 다양한 딥패이크 생성 방법(예: NeuralTextures, FaceSwap, Face2Face)과 다양한 압축 수준에 대해 일반화되고 다양한 압축 수준에 대해 강건한 정복 프레임워크를 개발하기 위해.

제안 방법

  • 주파수 주의 분산은 교사 모델의 고주파 특징에서 유도된 주의 맵을 사용하여 학습자 네트워크가 손실된 고주파 성분을 복구하고 집중하도록 이끌도록 설계된다.
  • 다중 시야 주의 분산은 슬라이스된 워셔스타인 거리(sliced Wasserstein distance)를 활용하여 학습자 모델의 특징 분포를 교사 모델의 분포와 정렬함으로써 상호 특징 간 상관관계를 유지한다.
  • 이 방법은 주파수 및 공간적 상관관계 패tern을 모두 학습자 모델이 교사 모델의 특징에서 학습할 수 있도록 통합된 KD 프레임워크 내에 통합된다.
  • 이 프레임워크는 다양한 백본 아키텍처(예: ResNet18, ResNet34, EfficientNet-B0)와 호환되어 융통성 있는 구현이 가능하다.
  • 정복 손실은 특징 수준의 지식 이전과 대조 학습을 결합하여 특징의 분류 능력과 일반화 능력을 향상시킨다.
  • 이 방법은 주파수 주의 및 다중 시야 주의 정복 손실의 가중 조합을 통해 엔드 투 엔드로 훈련되며, 표준 역전파 알고리즘으로 최적화된다.

실험 결과

연구 질문

  • RQ1지식 정복가 저품질 압축 딥패이크 이미지에서 손실된 고주파 아티팩트를 효과적으로 복구하여 탐지 정확도를 향상시킬 수 있는가?
  • RQ2다중 시야 주의 정복은 교사 및 학습자 네트워크 간에 상관된 픽셀 특징을 어떻게 향상시킬 수 있는가?
  • RQ3주파수 주의 정복과 다중 시야 주의 정복을 결합하면 단일 모odal 정복보다 고도로 압축된 딥패이크 탐지에서 상호 보완적 향상을 이룰 수 있는가?
  • RQ4제안된 방법은 다양한 딥패이크 생성 방법(예: NeuralTextures, FaceSwap, Face2Face)과 다양한 압축 수준(예: c23, c40)에 대해 얼마나 강건한가?
  • RQ5저품질 데이터로만 훈련된 학습자 모델에서 과적합 및 주의 분포 오류를 어느 정도 줄일 수 있는가?

주요 결과

  • Eff리시언넷-B0 백본에서 ADD는 압축 딥패이크 탐지에서 기준 모델 대비 최대 7.1%의 정확도 향상을 기록했으며, 테스트한 다섯 개의 데이터셋 전반에서 기준 모델을 초월했다.
  • ResNet50 백본에서 ADD는 NeuralTextures 데이터셋에서 기준 ResNet 대비 68.53%의 정확도를 기록했으며, 기준 모델의 60.27%보다 높았다.
  • 대조 학습을 통한 다중 시야 주의 정복은 비대조 기반 버전 대비 1.11% 향상된 성능을 기록하여 향상된 특징 분포 정렬의 유용성을 입증했다.
  • c23 및 c40와 같은 다양한 압축 수준에서 일관된 성능 향상을 보이며, 다양한 이미지 품질에 대한 강건성을 입증했다.
  • Grad-CAM 시각화 결과, ADD는 기준 모델이 비면역 영역을 활성화하는 것과 달리 학습자 모델의 주의를 얼굴 영역으로 정확히 이동시키며 배경 노이즈를 억제함을 확인했다.
  • α(주파수 주의 가중치) 및 β(다중 시야 주의 가중치)와 같은 하이퍼파rameter에 대해 덜 민감하며, 다양한 설정에서도 일관되게 뛰어난 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.