Skip to main content
QUICK REVIEW

[논문 리뷰] MRI-GAN: A Generalized Approach to Detect DeepFakes using Perceptual Image Assessment

Pratikkumar Prajapati, Chris Pollett|arXiv (Cornell University)|2022. 02. 28.
Digital Media Forensic Detection인용 수 9
한 줄 요약

이 논문은 구조적 유사도(SSIM)를 사용하여 진짜와 가짜 얼굴 간의 픽셀 수준 차이를 강조함으로써 DeepFakes를 탐지하는 '이미지 MRI'를 생성하는 GAN 기반 프레임워크인 MRI-GAN을 제안한다. 테스트 정확도가 74%로 순수 프레임 기반 기준보다 낮은 91%에 못 미치지만, 얼굴 교체 외의 다양한 비디오 조작에 적용 가능한 일반화된, 인지 기반 접근법을 제공한다.

ABSTRACT

DeepFakes are synthetic videos generated by swapping a face of an original image with the face of somebody else. In this paper, we describe our work to develop general, deep learning-based models to classify DeepFake content. We propose a novel framework for using Generative Adversarial Network (GAN)-based models, we call MRI-GAN, that utilizes perceptual differences in images to detect synthesized videos. We test our MRI-GAN approach and a plain-frames-based model using the DeepFake Detection Challenge Dataset. Our plain frames-based-model achieves 91% test accuracy and a model which uses our MRI-GAN framework with Structural Similarity Index Measurement (SSIM) for the perceptual differences achieves 74% test accuracy. The results of MRI-GAN are preliminary and may be improved further by modifying the choice of loss function, tuning hyper-parameters, or by using a more advanced perceptual similarity metric.

연구 동기 및 목표

  • 다양한 생성 기법에 걸쳐 DeepFakes를 탐지할 수 있는 일반화된 딥러닝 기반 방법을 개발하는 것.
  • 기존의 시각적 및 통계적 분석을 피하는 합성 미디어를 탐지하는 데 도전하는 것.
  • 특히 SSIM을 활용한 인지적 이미지 평가 기반으로, DeepFakes 내에서 미세한 조작을 식별하는 데 초점을 맞추는 것.
  • GAN 기반 MRI 생성 프레임워크의 성능을 진짜와 가짜 얼굴 콘텐츠를 구분하는 데서 평가하는 것.
  • 얼굴 교체 비디오 외에도 다른 형태의 비디오 조작을 탐지할 수 있는 기반을 마련하는 것.

제안 방법

  • MRI-GAN은 입력 이미지와 그에 해당하는 진짜 이미지 간의 인지적 차이를 계산함으로써, 가변적인 유사도 함수(예: SSIM)를 사용해 '이미지 MRI'를 생성하는 GAN을 훈련시킨다.
  • 모델은 생성자(generator)가 입력 이미지와 원본 진짜 이미지를 기반으로 이미지 차이(MRIs)를 학습하고, 판별자(discriminator)가 진짜와 생성된 MRIs를 구분하도록 하는 GAN 아키텍처를 사용한다.
  • 인지적 차이 함수 f는 조작을 나타내는 픽셀 수준의 이질성을 정량화하기 위해 SSIM을 사용하여 구현된다.
  • 별도의 DeepFake 탐지 모델은 생성된 MRI를 처리하며, 특징 추출을 위해 미리 훈련된 EfficientNet-B0를 사용하고, 이후 글로벌 평균 풀링과 활성화 함수로 ReLU 및 드롭아웃을 적용한 두 개의 히든 레이어를 가진 MLP를 거친다.
  • 영상 프레임 간의 얼굴 수준 예측은 임계값 기반 투표 메커니즘을 통해 집계되며, 얼굴의 일부가 가짜 확률 임계값을 초과하면 영상 전체를 가짜로 분류한다.
  • FAKE_FRAME_THRESHOLD 및 FAKE_FRACTION 등의 하이퍼파라미터는 그리드 서치를 통해 영상 수준의 분류 성능을 최적화하기 위해 튜닝된다.

실험 결과

연구 질문

  • RQ1GAN 기반 프레임워크가 인지적 이미지 차이(MRIs)를 생성함으로써 기존의 프레임 기반 모델 대비 DeepFakes 탐지 성능을 향상시킬 수 있는가?
  • RQ2SSIM은 얼굴 교체 영상 내에서 미세한 아티팩트를 식별하는 데 얼마나 효과적인 인지적 유사도 지표인가?
  • RQ3MRI-GAN 프레임워크는 다양한 DeepFakes 생성 방법과 실제 환경의 비디오 조건에 대해 얼마나 일반화되는가?
  • RQ4MRI-GAN은 얼굴 교체를 넘어서 다른 비디오 조작 형태를 탐지할 수 있도록 확장될 수 있는가?
  • RQ5얼굴 수준의 예측을 정확한 영상 수준의 분류로 집계하기 위해 최적의 하이퍼파라미터 설정은 무엇인가?

주요 결과

  • 순수 프레임 기반 모델은 91%의 테스트 정확도를 기록하여 비교를 위한 강력한 기준이 되었다.
  • SSIM을 인지적 차이 함수로 사용한 MRI-GAN 기반 방법은 74%의 테스트 정확도를 기록하여 기준 모델보다 낮은 성능을 보였다.
  • MRI-GAN 모델은 True Positive Rate(TPR)가 69%이고 False Negative Rate(FNR)가 31%로, 가짜 영상의 상당수를 놓친 것으로 나타났다.
  • MRI-GAN의 ROC 곡선 아래 면적(AUC)은 0.76로, 순수 프레임 기반 모델의 0.95에 비해 유의미하게 낮았다.
  • 그리드 서치를 통해 최적의 파라미터로 FAKE_FRAME_THRESHOLD = 0.70 및 FAKE_FRACTION = 0.30을 MRI-GAN에서, 0.80 및 0.30을 순수 프레임 기반 모델에서 확보하였다.
  • 저자들은 L2 손실 대신 L1 손실을 사용하거나, Zhai와 Min(2021)의 연구에서 제안한 고급 인지적 지표를 탐색함으로써 블러링을 줄이고 탐지 성능을 향상시킬 수 있는 잠재적 개선 방안을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.