Skip to main content
QUICK REVIEW

[논문 리뷰] Exposing GAN-synthesized Faces Using Landmark Locations

Xin Yang, Yuezun Li|arXiv (Cornell University)|2019. 03. 30.
Generative Adversarial Networks and Image Synthesis참고 문헌 18인용 수 14
한 줄 요약

이 논문은 GAN에 의해 생성된 얼굴을 분석함으로써 경량화된 방법을 제안한다. 이는 GAN에서 전역적 구조 제약 조건이 부재함으로 인해 일반적으로 비자연스러운 공간 배열을 보이는 얼굴 랜드마크 점들의 기하적 구성 분석을 기반으로 한다. 표준화된 랜드마크 좌표를 입력으로 사용할 때, SVM 분류기는 PGGAN에 의해 생성된 얼굴에서 94.13%의 AUROC를 달성하며, 더 깊은 CNN 모델들보다 뛰어나지만 계산 자원을 최소로 요구하고, 이미지 리사이징에 대해 강건하다.

ABSTRACT

Generative adversary networks (GANs) have recently led to highly realistic image synthesis results. In this work, we describe a new method to expose GAN-synthesized images using the locations of the facial landmark points. Our method is based on the observations that the facial parts configuration generated by GAN models are different from those of the real faces, due to the lack of global constraints. We perform experiments demonstrating this phenomenon, and show that an SVM classifier trained using the locations of facial landmark points is sufficient to achieve good classification performance for GAN-synthesized faces.

연구 동기 및 목표

  • GAN에 의해 생성된 현실적인 인간 얼굴의 증가하는 위협에 대응하기 위해, 이는 윤리적, 법적, 보안적 위험을 야기한다.
  • GAN 기반 얼굴 생성에서 전역적 구조 제약 조건의 부재로 인해 발생하는 얼굴 부분 구성의 미세한 기하학적 불일치를 식별하기 위해.
  • 얼굴 랜드마크 위치를 분류 특징으로 사용하여 경량화되고 확장 가능한 탐지 방법을 개발하기 위해.
  • PGGAN 생성 얼굴과 다른 합성 얼굴 변형(예: FaceForensics에 포함된 것들)에 대한 성능 평가를 수행하기 위해.
  • 저차원 기하학 기반 특징이 복잡한 딥러닝 모델보다 탐지 정확도에서 뛰어나며, 계산 비용을 줄일 수 있음을 입증하기 위해.

제안 방법

  • 이 방법은 사전 학습된 얼굴 정렬 모델을 사용하여 68개의 얼굴 랜드마크 점을 추출함으로써 GAN에 의해 생성된 얼굴을 탐지한다.
  • 랜드마크 좌표는 스케일, 회전, 이동의 변화를 보상하기 위해 표준 좌표계로 정규화된다.
  • 정규화된 랜드마크 위치는 136차원의 특징 벡터(68×2)로 평탄화되고, 훈련 세트의 평균과 표준편차를 사용하여 표준화된다.
  • 클래스 수의 비율에 반비례하는 샘플 가중치를 사용하여 클래스 균형 손실을 적용한 라디얼 기저 함수(RBF) 커널 SVM 분류기가 훈련된다.
  • 하이퍼파라미터는 5개의 교차 검증을 통해 튜닝되며, 모델은 PGGAN에 의해 생성된 얼굴과 실제 CelebA 얼굴 모두에서 평가된다.
  • 이 방법은 FaceForensics 데이터셋에서도 테스트되었으며, 각 비디오의 프레임 수준 예측을 평균화하여 성능을 향상시켰다.

실험 결과

연구 질문

  • RQ1랜드마크 구성의 기하학적 불일치는 실제 얼굴과 GAN에 의해 생성된 얼굴을 구별하는 신뢰할 수 있는 지표가 될 수 있는가?
  • RQ2랜드마크 위치를 사용하는 경량 SVM 분류기는 모델 복잡성과 강건성 측면에서 딥 뉴럴 네트워크보다 GAN에 의해 생성된 얼굴을 탐지하는 데 뛰어나게 성능을 내는가?
  • RQ3이미지 리사이징은 랜드마크 기반 탐지 방법의 성능에 어떻게 영향을 미치는가? 이미지 기반 딥 러닝 모델과 비교하여.
  • RQ4제안된 방법은 GAN을 초월한 다른 종류의 합성 얼굴 변형, 예를 들어 FaceForensics 벤치마크에 포함된 것들에도 일반화될 수 있는가?
  • RQ5얼굴 표정과 가림물의 정도가 랜드마크 탐지 정확도와 이후 분류 성능에 어느 정도의 영향을 미치는가?

주요 결과

  • SVM 분류기는 오직 136차원의 랜드마크 특징만을 사용하여 PGGAN에 의해 생성된 얼굴에서 AUROC 94.13%를 달성하였으며, 동일한 데이터셋에서 VGG19와 XceptionNet과 같은 여러 깊은 CNN 모델들을 능가하였다.
  • 랜드마크 기반 방법은 이미지 리사이징에 대해 강건했으며, 성능이 확대 또는 축소에 크게 영향을 받지 않았다. 반면 딥 러닝 모델은 리사이징으로 인한 아티팩트가 발생할 수 있어 영향을 받을 수 있었다.
  • FaceForensics 데이터셋에서, 프레임 수준의 예측은 AUROC 0.83를 기록했으며, 비디오 프레임 간 예측을 평균화함으로써 0.90으로 향상되었다.
  • 이 방법은 훨씬 적은 파라미터를 요구하며, GPU 가속을 필요로 하는 딥 러닝 모델과는 달리 CPU에서 훈련 및 테스트가 가능하다.
  • 실제 얼굴에서의 오진 양성 반응은 주로 강한 표정이나 가림물이 있는 얼굴에서 정확한 랜드마크 탐지가 어려워서 발생했으며, 분류기 자체의 내재된 편향 때문이 아니었다.
  • 결과는 GAN이 매우 현실적인 얼굴 세부 정보를 생성하지만, 종종 자연스러운 얼굴 구성 요소 간의 일관성 있는 공간 관계를 유지하지 못한다는 것을 확인한다. 이러한 불일치는 랜드마크 기하학을 통해 탐지 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.