Skip to main content
QUICK REVIEW

[논문 리뷰] Using GANs to Synthesise Minimum Training Data for Deepfake Generation

Simranjeet Singh, Rajneesh Sharma|arXiv (Cornell University)|2020. 11. 10.
Generative Adversarial Networks and Image Synthesis참고 문헌 11인용 수 5
한 줄 요약

이 논문은 대규모 데이터셋에서 유명인 존 올리버의 1,000장의 다양한 고화질 얼굴 이미지를 스타일 제너레이티브 어드버서 네트워크2(StyleGAN2)를 사용해 합성하여, 극소수의 실제 학습 데이터로도 거의 현실적인 딥페이크 영상을 제작할 수 있도록 제안한다. 실제 데이터가 아닌 합성 이미지만을 사용했음에도 불구하고, 결과적으로 얻어진 딥페이크 영상은 높은 지각적 품질과 얼굴의 다양성을 확보하였으며, 이는 GAN에 의해 생성된 데이터가 딥페이크 생성 시 대규모 실재 데이터셋에 효과적으로 대체될 수 있음을 보여준다.

ABSTRACT

There are many applications of Generative Adversarial Networks (GANs) in fields like computer vision, natural language processing, speech synthesis, and more. Undoubtedly the most notable results have been in the area of image synthesis and in particular in the generation of deepfake videos. While deepfakes have received much negative media coverage, they can be a useful technology in applications like entertainment, customer relations, or even assistive care. One problem with generating deepfakes is the requirement for a lot of image training data of the subject which is not an issue if the subject is a celebrity for whom many images already exist. If there are only a small number of training images then the quality of the deepfake will be poor. Some media reports have indicated that a good deepfake can be produced with as few as 500 images but in practice, quality deepfakes require many thousands of images, one of the reasons why deepfakes of celebrities and politicians have become so popular. In this study, we exploit the property of a GAN to produce images of an individual with variable facial expressions which we then use to generate a deepfake. We observe that with such variability in facial expressions of synthetic GAN-generated training images and a reduced quantity of them, we can produce a near-realistic deepfake videos.

연구 동기 및 목표

  • 제한된 실재 얼굴 이미지 데이터를 보유한 비유명인 개인을 대상으로 고품질 딥페이크를 생성하는 데 도전하는 것.
  • GAN에 의해 생성된 합성 얼굴 이미지가 딥페이크 모델의 효과적인 학습 데이터로 기능할 수 있는지 조사하는 것.
  • 합성 학습 데이터의 얼굴 표정 다양성과 이미지 품질이 딥페이크의 현실성에 미치는 영향을 평가하는 것.
  • 다양하고 소수의 GAN 기반 합성 이미지로도 거의 구분이 안 될 정도로 정교한 딥페이크 영상을 생성할 수 있음을 입증하는 것.
  • 수천 장의 실재 얼굴 이미지가 필요 없이도 평범한 개인의 딥페이크를 제작할 수 있는 방법을 제공하는 것.

제안 방법

  • 유튜브에서 추출한 존 올리버의 132,000장의 영상 프레임을 기반으로 스타일 제너레이티브 어드버서 네트워크2(StyleGAN2) 모델을 훈련시어 합성 얼굴 이미지를 생성하는 것.
  • 표정과 자세의 다양성이 높은 1,000장의 합성 얼굴 이미지 데이터셋을 생성하는 것.
  • OpenFace(평균 점수 0.401, 분산 0.068)와 face_recognition 라이브러리를 사용해 이미지 품질과 얼굴 다양성을 평가하는 것.
  • GAN에 의해 생성된 이미지의 품질과 다양성을 평가하기 위해 인셉션 스코어(1.628)를 계산하는 것.
  • 대화를 생성하기 위해 챗봇(ChatterBot)을 사용하고, 주어진 대화를 연기한 실제 영상 촬영을 수행하는 것.
  • 딥페이플레이드 프레임워크를 적용하여 256x256 해상도 영상 프레임 전반에 걸쳐 주제의 얼굴을 GAN에 의해 생성된 존 올리버의 얼굴로 교체하는 것.

실험 결과

연구 질문

  • RQ1표현 다양성이 높은 1,000장의 GAN 기반 합성 얼굴 이미지 데이터셋이 고품질 딥페이크 영상 생성에 기여할 수 있는가?
  • RQ2딥페이크 학습 맥락에서 GAN에 의해 생성된 이미지의 얼굴 다양성과 현실성은 실재 이미지와 비교해 어떻게 되는가?
  • RQ3사전 훈련된 GAN에서 생성된 합성 이미지가 딥페이크 생성 시 대규모 실재 데이터셋에 얼마나 효과적으로 대체될 수 있는가?
  • RQ4합성 학습 이미지만을 사용해 제작된 딥페이크 영상의 지각적 품질은 어떠한가? 실재 데이터 기반 딥페이크와 비교해 볼 때 어떻게 되는가?
  • RQ5합성 데이터로만 학습된 경우, 딥페이크 출력이 영상 프레임 간에 시각적 일관성을 유지할 수 있는가?

주요 결과

  • GAN에 의해 생성된 1,000장의 이미지 데이터셋은 높은 얼굴 다양성을 보였으며, OpenFace는 평균 유사도 점수 0.401과 분산 0.068를 기록하여 일관된 신원과 다양한 표정을 나타내었다.
  • 생성된 이미지에 대한 인셉션 스코어 1.628은 적절한 다양성과 품질 수준을 나타내어, 이들이 학습 데이터로 사용될 수 있음을 뒷받침한다.
  • 합성 이미지만을 사용해 생성된 딥페이크 영상은 거의 현실적인 품질을 확보하였으며, 얼굴 교체가 영상 전반에 걸쳐 신뢰할 만하고 일관되게 보였다.
  • 프레임 간 약간의 색상 일관성 문제에도 불구하고, 영상가 공개되었고 시각적으로 타당성이 있다고 평가되었으며, 이는 합성 데이터가 딥페이크 학습에 활용될 수 있음을 보여준다.
  • 이 방법은 실재 데이터셋이 대규모로 필요 없이도 비유명인 주제에 대해 딥페이크를 성공적으로 제작하였다.
  • 결과적으로 GAN 기반 데이터 합성 기법은 딥페이크 생성에 필요한 데이터 요구량을 크게 줄일 수 있으며, 同시에 높은 출력 품질을 유지할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.