Skip to main content
QUICK REVIEW

[논문 리뷰] Zooming into Face Forensics: A Pixel-level Analysis

Jia Li, Tong Shen|arXiv (Cornell University)|2019. 12. 12.
Face recognition and analysis참고 문헌 47인용 수 8
한 줄 요약

이 논문은 얼굴 포렌식스를 픽셀 수준의 세분화 문제로 재정의하여, 기존의 분류 작업에서 조작된 영역을 국소화하는 문제로 전환한다. FaceForensics++ 데이터셋에서 세분화 아키텍처를 평가함으로써, 세분화 모델이 가짜 얼굴을 탐지하는 데 있어 분류 네트워크보다 유의미하게 뛰어난 성능을 보임을 입증하며, 다양한 조작 방법에서 최신 기준(mIoU)을 확립하는 새로운 강력한 베이스라인을 수립한다.

ABSTRACT

The stunning progress in face manipulation methods has made it possible to synthesize realistic fake face images, which poses potential threats to our society. It is urgent to have face forensics techniques to distinguish those tampered images. A large scale dataset "FaceForensics++" has provided enormous training data generated from prominent face manipulation methods to facilitate anti-fake research. However, previous works focus more on casting it as a classification problem by only considering a global prediction. Through investigation to the problem, we find that training a classification network often fails to capture high quality features, which might lead to sub-optimal solutions. In this paper, we zoom in on the problem by conducting a pixel-level analysis, i.e. formulating it as a pixel-level segmentation task. By evaluating multiple architectures on both segmentation and classification tasks, We show the superiority of viewing the problem from a segmentation perspective. Different ablation studies are also performed to investigate what makes an effective and efficient anti-fake model. Strong baselines are also established, which, we hope, could shed some light on the field of face forensics.

연구 동기 및 목표

  • 기존의 얼굴 포렌식스 방법이 전역적 분류 작업으로 간주하는 데서 비롯하는 한계를 해결하기 위해.
  • 얼굴 포렌식스가 분류 문제보다 픽셀 수준의 세분화 문제로 더 잘 정의될 수 있는지 조사하기 위해.
  • 절단 실험을 통해 가짜 탐지에 가장 효과적이고 효율적인 네트워크 아키텍처를 규명하기 위해.
  • 세분화 기반 모델을 사용하여 얼굴 포렌식스의 새로운 강력한 기준을 수립하기 위해.

제안 방법

  • 저자는 얼굴 포렌식스를 의미적 세분화 작업으로 재정의하여, 각 픽셀의 진위도 점수를 예측하도록 모델을 훈련시켰다.
  • 저자들은 FaceForensics++ 데이터셋에서 Xception, VGG 변종, UNet 및 자체 개발 모델(FN3)을 포함한 여러 아키텍처를 평가하였다.
  • 조작된 픽셀과 진짜 픽셀 간의 클래스 불균형을 다루기 위해 교차 엔트로피 손실과 포칼 손실을 함께 사용하여 모델을 훈련시켰다.
  • 활성화 맵을 사용하여 커널 시각화를 수행하여 학습된 특징을 해석하고 모델의 동작을 평가하였다.
  • 초기화 방식(전체에서 학습 vs. ImageNet 미리 훈련된 모델) 간 성능을 비교하는 절단 실험을 수행하였다.
  • 지역화 정확도 평가를 위해 주요 평가 지표로 평균 교차율(mIoU)을 사용하였다.

실험 결과

연구 질문

  • RQ1얼굴 포렌식스는 분류 문제보다 세분화 문제로 더 잘 정의될 수 있는가?
  • RQ2픽셀 수준의 가짜 탐지에 가장 적합한 신경망 아키텍처는 무엇인가?
  • RQ3모델의 깊이(얕은 모델 vs. 깊은 모델)는 얼굴 포렌식스 세분화 성능에 영향을 미치는가?
  • RQ4ImageNet 미리 훈련은 얼굴 포렌식스 세분화 모델의 일반화 능력을 향상시키는가?

주요 결과

  • 세분화 기반 모델은 분류 네트워크보다 유의미하게 높은 mIoU 점수를 기록하였으며, 최고의 모델은 FaceForensics++ 테스트 세트에서 92.45 mIoU에 도달하였다.
  • 깊은 모델인 Xception(36층)에 비해 얕은 모델인 VGG5(4층)가 더 뛰어난 성능을 보였으며, 이는 얼굴 포렌식스가 저수준 시각 작업임을 시사한다.
  • ImageNet 미리 훈련이 성능 향상에 거의 기여하지 않아, 일반적인 시각 특징이 이 특정 작업에 유용하지 않음을 시사한다.
  • 커널 시각화 결과, 인간의 인지 범위를 초월하는 미묘하고 직관적이지 않은 특징이 모델이 학습하고 있음을 확인하였으며, 이는 자동 탐지의 필요성을 강조한다.
  • VGG5 기반 세분화 모델은 Deepfakes에서 95.78% mIoU, Face2Face에서 96.21% mIoU, FaceSwap에서 94.81% mIoU, NeuralTextures에서 75.60% mIoU를 기록하여 다양한 조작 유형에 대해 뛰어난 강건성을 보였다.
  • 본 연구는 얼굴 포렌식스 분야에 새로운 SOTA 기준을 수립하였으며, 최고의 성능을 보인 모델은 이전의 분류 기반 접근 방식보다 지역화 정확도에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.