Skip to main content
QUICK REVIEW

[논문 리뷰] Swapped Face Detection using Deep Learning and Subjective Assessment

Xinyi Ding, Zohreh Raziei|arXiv (Cornell University)|2019. 09. 10.
Face recognition and analysis참고 문헌 24인용 수 7
한 줄 요약

이 논문은 진정성 있는 얼굴 교체 탐지 모델을 제안하며, 낮은 거짓 경고를 동반하면서 96% 이상의 진성 양성률을 달성한다. 또한 로짓 차이를 통한 불확실성 추정을 도입하여 신뢰도를 향상시켰다. 인간 대조 평가를 위해 자체 웹사이트를 구축하여 인간의 현실감 인식과 모델의 불확실성 간에 높은 상관관계(r > 0.75)를 확인했으며, 현재까지 가장 큰 공개된 정적 이미지 얼굴 교체 데이터셋을 공개하였다.

ABSTRACT

The tremendous success of deep learning for imaging applications has resulted in numerous beneficial advances. Unfortunately, this success has also been a catalyst for malicious uses such as photo-realistic face swapping of parties without consent. Transferring one person's face from a source image to a target image of another person, while keeping the image photo-realistic overall has become increasingly easy and automatic, even for individuals without much knowledge of image processing. In this study, we use deep transfer learning for face swapping detection, showing true positive rates >96% with very few false alarms. Distinguished from existing methods that only provide detection accuracy, we also provide uncertainty for each prediction, which is critical for trust in the deployment of such detection systems. Moreover, we provide a comparison to human subjects. To capture human recognition performance, we build a website to collect pairwise comparisons of images from human subjects. Based on these comparisons, images are ranked from most real to most fake. We compare this ranking to the outputs from our automatic model, showing good, but imperfect, correspondence with linear correlations >0.75. Overall, the results show the effectiveness of our method. As part of this study, we create a novel, publicly available dataset that is, to the best of our knowledge, the largest public swapped face dataset created using still images. Our goal of this study is to inspire more research in the field of image forensics through the creation of a public dataset and initial analysis.

연구 동기 및 목표

  • 실제 환경 적용에서 신뢰도를 높이기 위해 불확실성 추정 기능을 갖춘 신뢰할 수 있는 딥러닝 기반 얼굴 교체 탐지 시스템을 개발하기 위해.
  • 인간의 인식과의 비교를 위해 인간 피험자로부터 쌍대 비교 이미지 평가를 수집하여 모델 성능을 평가하기 위해.
  • 86명의 유명인을 포함해 총 420,053장의 이미지로 구성된, 현재까지 가장 큰 공개된 정적 이미지 얼굴 교체 얼굴 데이터셋을 제작하고 공개하기 위해.
  • 모델 예측과 인간 순위 간의 일치도를 평가하여 가짜 얼굴을 탐지하는 데 있어 인간의 직관과 얼마나 유사한지 확인하기 위해.
  • 기준 데이터셋과 비교 분석을 제공하여 이미지 포렌식 분야의 향후 연구를 자극하기 위해.

제안 방법

  • 대규모 얼굴 교체 데이터셋으로 훈련된 사전 학습된 ResNet-50 모델을 사용하여 전이 학습을 수행하고, 실재 대 가짜 얼굴을 이진 분류하기 위해 최적화한다.
  • 두 출력 클래스 간의 로짓 차이(오즈 비율)를 사용하여 예측 불확실성 추정을 수행하며, 작은 차이가 낮은 신뢰도를 의미한다고 가정한다.
  • 모델의 예측 불확실성과 인간의 현실감 인식 간 상관관계를 분석하기 위해, 400개의 선택된 이미지에 대해 인간 대조 평가를 수집하기 위해 자체 웹사이트를 구축한다.
  • 정확도를 유지하면서도 필요한 쌍대 비교 수를 줄이기 위해 근사 순위 알고리즘(Hamming-LUCB)을 적용한다.
  • Grad-CAM을 사용하여 주의 맵을 시각화하여, 모델이 얼굴 영역(코와 눈)에 집중하고 있음을 확인하였으며, 이는 인간의 시각적 주의와 일치한다.
  • 선형 상관관계 및 스피어만 순위 상관관계를 사용하여 모델의 로짓 마진(불확실성)과 인간 순위 간 유사성을 평가한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델의 얼굴 교체 탐지 성능는 인간의 인식과 비교해 얼마나 우수한가?
  • RQ2로짓 차이를 통한 모델의 불확실성 추정은 인간이 가짜 얼굴을 탐지하기 어려운 정도와 상관관계가 있는가?
  • RQ3모델이 생성한 얼굴 이미지 순위와 인간 쌍대 비교 평가를 통해 유도된 순위 간 유사도는 어느 정도인가?
  • RQ4대규모이고 다양한 데이터셋에서 모델의 진성 양성률과 거짓 경고율 성능은 어떠한가?
  • RQ5모델의 주의 집중 영역이 인간의 시각적 주의 영역과 얼굴 기능에서 얼마나 일치하는가?

주요 결과

  • 제안된 모델는 매우 적은 거짓 경고를 동반하면서도 96%를 초과하는 진성 양성률을 달성하여 높은 탐지 정확도를 입증하였다.
  • 로짓 차이를 기반으로 한 모델의 불확실성 추정은 인간 인식과 강한 상관관계를 보였으며, AE-GAN 및 Nirkin의 방법으로 생성된 얼굴에 대해 선형 상관관계 >0.75, 스피어만 순위 상관관계 >0.75를 기록하였다.
  • AE-GAN 방법의 경우, 모델의 로짓 마진와 인간 순위 간 선형 상관관계는 0.8332이며, Nirkin의 방법의 경우 0.7896로, 모두 p값 < 0.01이었다.
  • 인간 피험자들은 더 사진처럼 현실감 있고 해상도가 높은 Nirkin의 방법으로 생성된 얼굴을 탐지하는 데 더 어려움을 느꼈다. 반면 AE-GAN 방법으로 생성된 얼굴은 더 흐릿한 편이었다.
  • Grad-CAM 시각화 결과, 모델가 중심 얼굴 영역(코와 눈)에 집중하고 있음을 확인하였으며, 이는 인간의 시선 패턴과 일치하고, 일반적으로 아티팩트가 존재하는 영역일 가능성이 높다.
  • 본 연구는 86명의 유명인을 포함해 총 420,053장의 이미지로 구성된 새로운 공개 데이터셋을 공개하였으며, 현재까지 알려진 바에서 가장 큰 정적 이미지 얼굴 교체 얼굴 데이터셋이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.