Skip to main content
QUICK REVIEW

[논문 리뷰] KoDF: A Large-scale Korean DeepFake Detection Dataset

Patrick Kwon, Jaeseong You|arXiv (Cornell University)|2021. 03. 18.
Face recognition and analysis참고 문헌 38인용 수 8
한 줄 요약

KoDF는 403명의 한국인을 대상으로 한 62,166건의 진짜 영상과 175,776건의 위조 영상로 구성된 대규모, 분포 제어형 한국어 딥패이크 검출 데이터셋이며, 6가지 합성 방법과 악성 공격 시뮬레이션을 포함한다. 이는 KoDF를 기존의 FF++ 및 DFDC 데이터셋과 결합할 경우 검출 모델의 일반화 능력이 크게 향상됨을 보여주며, 단일 데이터셋으로만 훈련된 모델보다 뛰어난 성능을 발휘한다.

ABSTRACT

A variety of effective face-swap and face-reenactment methods have been publicized in recent years, democratizing the face synthesis technology to a great extent. Videos generated as such have come to be called deepfakes with a negative connotation, for various social problems they have caused. Facing the emerging threat of deepfakes, we have built the Korean DeepFake Detection Dataset (KoDF), a large-scale collection of synthesized and real videos focused on Korean subjects. In this paper, we provide a detailed description of methods used to construct the dataset, experimentally show the discrepancy between the distributions of KoDF and existing deepfake detection datasets, and underline the importance of using multiple datasets for real-world generalization. KoDF is publicly available at https://moneybrain-research.github.io/kodf in its entirety (i.e. real clips, synthesized clips, clips with adversarial attack, and metadata).

연구 동기 및 목표

  • 기존 딥패이크 검출 데이터셋에서 아시아계 주체의 부족한 표현을 보완하기 위해.
  • 한국인 주체를 대상으로 한 대규모, 고품질의 딥패이크 데이터셋을 제작하여 인구통계학적 및 콘텐츠 분포를 제어하기 위해.
  • 다양한 합성 방법과 악성 공격 시뮬레이션을 통합하여 모델의 강건성 향상하기 위해.
  • 다양한 데이터셋을 결합하는 것이 실세계 일반화에 필수적임을 입증하기 위해.
  • 향후 딥패이크 검출 분야의 연구를 지원하기 위해 공개 가능한 벤치마크 제공하기 위해.

제안 방법

  • 윤리적인 데이터 수확을 확보하기 위해, 100명의 유료 한국 연기자로부터 동의를 받은 진짜 영상 수집.
  • 6가지 다른 딥패이크 생성 모델을 사용하여 175,776건의 위조 영상 합성하여 방법론적 다양성 확보.
  • 연령, 성별, 콘텐츠 유형에 따라 인구통계학적 분포를 제어하여 데이터셋의 균형과 대표성을 향상.
  • 모델의 강건성 테스트를 위해 악성 공격 샘플 도입.
  • 모든 클립에 대해 MTCNN을 사용하여 얼굴 프레임 추출하여 훈련 및 평가에 일관된 입력 확보.
  • FF++, DFDC, KoDF를 결합한 데이터셋을 사용해 딥패이크 검출 모델을 훈련 및 평가하여 일반화 성능 평가.

실험 결과

연구 질문

  • RQ1대규모, 분포 제어형 딥패이크 데이터셋은 다양한 실세계 딥패이크 시나리오에서 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ2KoDF로 훈련된 딥패이크 검출 모델의 성능은 기존 데이터셋인 FF++ 및 DFDC로 훈련된 모델보다 어떻게 다른가?
  • RQ3여러 개의 딥패이크 데이터셋을 결합할 경우, 도메인 외부 테스트 세트에서의 검출 강건성은 어느 정도 향상되는가?
  • RQ4KoDF의 제어된 인구통계학적 및 콘텐츠 분포는 비제어 데이터셋보다 더 나은 모델 일반화를 이끌어낼 수 있는가?
  • RQ5KoDF에 포함된 악성 샘플은 실세계 배포에서의 변형에 대한 모델 내성 평가에 효과적으로 기여하는가?

주요 결과

  • KoDF를 포함한 단일 데이터셋으로만 훈련된 모델들은 도메인 외부 테스트 세트에 대해 일반화 능력이 떨어지며, 이는 분포 불일치를 시사한다.
  • KoDF를 FF++ 및 DFDC와 결합하면, KoDF의 악성 공격 샘플을 포함한 미리보지 않은 데이터셋에서 검출 성능이 크게 향상된다.
  • 세 데이터셋(FF++, DFDC, KoDF)을 모두 사용해 훈련한 모델이 모든 테스트 세트에서 가장 높은 정확도를 기록하여 KoDF의 상호보완적 가치를 입증한다.
  • KoDF의 연령, 성별, 콘텐츠 분포 제어로 인해 DF-1.0 및 FF++와 같은 비제어 데이터셋보다 더 강건하고 다양한 훈련 데이터를 확보할 수 있다.
  • KoDF에 악성 공격 샘플을 포함시켜, 이러한 데이터 없이 훈련된 모델이 표적적 변형에 취약함을 확인하여, 악성 데이터의 훈련 내재화 중요성을 강조한다.
  • 본 연구는 딥패이크 검출이 메소드 특화 아티팩트로 인해 과적합에 매우 취약하므로, 실세계 일반화를 위해 다중 데이터셋 훈련이 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.