Skip to main content
QUICK REVIEW

[논문 리뷰] Deepfake detection: humans vs. machines

Pavel Korshunov, Sébastien Marcel|arXiv (Cornell University)|2020. 09. 07.
Generative Adversarial Networks and Image Synthesis참고 문헌 17인용 수 11
한 줄 요약

이 연구는 페이스북 딥페이크 데이터셋에서 수작업으로 선별한 120개의 영상 자료를 이용해 인간과 기계의 딥페이크 영상 탐지 성능을 평가한다. 인간은 현실적인 딥페이크 영상에 대해 75.5%의 경우에서 실패하며 탐지하지 못하는 반면, 최신 딥러닝 모델(Xception 및 EfficientNet)은 인간이 쉽게 식별할 수 있는 딥페이크 영상에서도 자주 실패하며, 인간과 기계 간의 딥페이크 인식 방식에 근본적인 괴리가 있음을 드러낸다.

ABSTRACT

Deepfake videos, where a person's face is automatically swapped with a face of someone else, are becoming easier to generate with more realistic results. In response to the threat such manipulations can pose to our trust in video evidence, several large datasets of deepfake videos and many methods to detect them were proposed recently. However, it is still unclear how realistic deepfake videos are for an average person and whether the algorithms are significantly better than humans at detecting them. In this paper, we present a subjective study conducted in a crowdsourcing-like scenario, which systematically evaluates how hard it is for humans to see if the video is deepfake or not. For the evaluation, we used 120 different videos (60 deepfakes and 60 originals) manually pre-selected from the Facebook deepfake database, which was provided in the Kaggle's Deepfake Detection Challenge 2020. For each video, a simple question: "Is face of the person in the video real of fake?" was answered on average by 19 naïve subjects. The results of the subjective evaluation were compared with the performance of two different state of the art deepfake detection methods, based on Xception and EfficientNets (B4 variant) neural networks, which were pre-trained on two other large public databases: the Google's subset from FaceForensics++ and the recent Celeb-DF dataset. The evaluation demonstrates that while the human perception is very different from the perception of a machine, both successfully but in different ways are fooled by deepfakes. Specifically, algorithms struggle to detect those deepfake videos, which human subjects found to be very easy to spot.

연구 동기 및 목표

  • 평균 인간 관찰자가 다양한 수준의 시각적 결함 심각도에서 딥페이크 영상이 얼마나 현실적으로 보이는지 평가하기 위해.
  • 동일한 영상 세트를 사용하여 인간의 탐지 성능과 최신 딥페이크 탐지 알고리즘 간의 성능을 비교하기 위해.
  • 특히 시각적 결함 탐지 가능성 측면에서 인간의 인식과 기계의 인식 간 상관관계가 있는지 조사하기 위해.
  • 다른 데이터셋에서 훈련된 딥페이크 탐지 모델의 일반화 능력을, 미리 보지 않은 페이스북에서 생성된 딥페이크 영상에 대해 테스트하기 위해.
  • 기계 시각이 딥페이크 탐지에서 인간의 시각 인식과 일치한다는 가정을 도전하기 위해.

제안 방법

  • 120개의 영상(실제 영상 60개, 딥페이크 영상 60개)을 페이스북 딥페이크 데이터셋에서 선별하여, 매우 쉬움, 쉬움, 보통, 어려움, 매우 어려움의 다섯 가지 난이도 수준으로 분류한 후, 19명의 평균 참여자(초보자)가 각 영상의 얼굴이 진짜인지 가짜인지 여부를 평가하여 인간의 인식 기준을 확보하였다.
  • Xception 및 EfficientNet-B4와 같은 최신 딥페이크 탐지 모델을 동일한 영상 세트에서 평가하였으며, 각각 Google의 FaceForensics++ 서브셋과 Celeb-DF 데이터셋에서 미리 훈련하였다.
  • 실제 구현 조건을 시뮬레이션하기 위해 각 훈련 데이터베이스의 개발 세트에서 10%의 오인수락률(FAR) 임계값을 사용하여 성능을 측정하였다.
  • 전체 테스트 세트에서 모델 및 인간 참가자의 전반적인 탐지 성능를 비교하기 위해 수신기 작동 특성(ROC) 곡선과 AUC 값 계산을 수행하였다.
  • 딥페이크 카테고리 간 탐지 정확도를 비교하여 인간과 기계의 인식 격차를 분석하였으며, 특히 인간이 쉽게 탐지할 수 있는 위조 영상에서 모델이 실패하는 경우에 초점을 맞추었다.

실험 결과

연구 질문

  • RQ1평균 인간 관찰자가 다양한 수준의 시각적 결함 심각도에서 딥페이크 영상을 얼마나 정확하게 탐지할 수 있는가?
  • RQ2최신 딥러닝 기반 딥페이크 탐지 모델이 페이스북 데이터셋에서 생성된 새로운 딥페이크 영상에 대해 얼마나 잘 일반화되는가?
  • RQ3인간의 딥페이크 현실성 인식과 기계 학습 모델의 탐지 성능 간 상관관계가 있는가?
  • RQ4왜 일부 딥페이크 탐지 모델은 인간이 쉽게 탐지할 수 있는 딥페이크 영상에서 실패하는가?
  • RQ5훈련 데이터 분포와 임계값 설정이 딥페이크 탐지 시스템의 실생활 성능에 어떤 영향을 미치는가?

주요 결과

  • 시각적으로 현실적인 딥페이크 영상에서 인간 참가자들은 오직 24.5%의 경우에만 정확히 탐지하였으며, 이는 고품질의 딥페이크 영상 75.5%가 평균 관찰자를 속였음을 의미한다.
  • 인간의 탐지 정확도는 난이도 수준에 따라 체계적으로 변동하였으며, '매우 쉬움' 딥페이크의 경우 95%를 정확히 식별했지만, '매우 어려움'의 경우는 오직 25%에 그쳤다. 이는 다양한 카테고리 간 일관된 인식 패턴을 보임을 시사한다.
  • Xception 및 EfficientNet 모델은 그들의 탐지 성능와 인간의 난이도 인식 간 상관관계를 보이지 않았으며, 인간이 쉽게 탐지할 수 있는 딥페이크 영상에서 성능이 떨어졌다.
  • 모델은 전체 테스트 세트에서 AUC 87.47%의 성능를 기록하였으며, 인간 참가자보다 높은 성능를 보였지만, 이는 더 복잡한 시각적 결함를 탐지할 수 있었기 때문이며, 일반화 능력이 뛰어나서가 아니었다.
  • 연구는 인간과 기계의 인식 간 근본적인 괴리를 드러내었으며, 기계는 인간이 쉽게 인지할 수 있는 시각적으로 명백한 딥페이크 영상에서 실패하는 경우가 많다. 이는 기계 시각이 인간의 시각적 추론 방식을 반영하지 않는다는 것을 시사한다.
  • 임계값 설정과 훈련 데이터가 모델 성능에 큰 영향을 미쳤으며, Celeb-DF에서 훈련된 모델은 이와 같은 새로운 페이스북 딥페이크 데이터셋에서 Google의 FaceForensics++ 서브셋에서 훈련된 모델보다 더 우수한 일반화 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.