Skip to main content
QUICK REVIEW

[논문 리뷰] DCFace: Synthetic Face Generation with Dual Condition Diffusion Model

Minchul Kim, Feng Liu|arXiv (Cornell University)|2023. 04. 14.
Face recognition and analysis인용 수 4
한 줄 요약

이 논문은 신원(ID)와 스타일(예: 자세, 조명, 표정)을 별도로 제어함으로써 고해상도 합성 얼굴 이미지를 생성하는 이중 조건 확산 모델인 DCFace를 제안한다. 이는 다양한 스타일에서 동일한 주제에 대해 일관된 다수의 이미지를 생성할 수 있도록 한다. DCFace로 생성된 데이터로 훈련된 얼굴 인식 모델은 다섯 개의 벤치마크 데이터셋 중 네 개에서 이전 방법보다 평균 6.11% 높은 정확도를 달성하여 실데이터 훈련에 가까운 성능을 확보한다.

ABSTRACT

Generating synthetic datasets for training face recognition models is challenging because dataset generation entails more than creating high fidelity images. It involves generating multiple images of same subjects under different factors ( extit{e.g.}, variations in pose, illumination, expression, aging and occlusion) which follows the real image conditional distribution. Previous works have studied the generation of synthetic datasets using GAN or 3D models. In this work, we approach the problem from the aspect of combining subject appearance (ID) and external factor (style) conditions. These two conditions provide a direct way to control the inter-class and intra-class variations. To this end, we propose a Dual Condition Face Generator (DCFace) based on a diffusion model. Our novel Patch-wise style extractor and Time-step dependent ID loss enables DCFace to consistently produce face images of the same subject under different styles with precise control. Face recognition models trained on synthetic images from the proposed DCFace provide higher verification accuracies compared to previous works by $6.11\%$ on average in $4$ out of $5$ test datasets, LFW, CFP-FP, CPLFW, AgeDB and CALFW. Code is available at https://github.com/mk-minchul/dcface

연구 동기 및 목표

  • 얼굴 인식 모델 훈련을 위한 대규모, 레이블 일관성 있는, 다양한 합성 얼굴 데이터셋을 생성하는 데 도전하는 것.
  • 이미지 생성에서 신원과 스타일 요소를 동시에 제어함으로써 기존 GAN 및 3D 모델 기반 방법을 초월하는 것.
  • 실데이터에 의존하지 않고도 합성 데이터만으로도 높은 얼굴 인식 성능를 달성함으로써 개인정보 침해를 동반하는 웹 크롤링 데이터에 대한 의존도를 줄이는 것.
  • 합성 데이터에서 클래스 간 변동성(다양한 신원), 클래스 내 변동성(한 신원당 다수의 스타일), 레이블 일관성 간 균형을 이루는 것.
  • 얼굴 인식 벤치마크에서 합성 데이터와 실데이터 간 성능 격차를 해소하는 것.

제안 방법

  • 이중 단계 생성 프레임워크: 첫 번째 단계에서는 확산 모델을 사용해 고품질의 신원 특화 얼굴 이미지를 생성하고, 두 번째 단계에서는 스타일 백업에서 추출한 스타일 이미지와 병합함.
  • 패치 단위 스타일 추출기를 도입하여 신원에서 스타일 정보(자세, 조명, 표정)를 분리함으로써 세밀한 스타일 제어를 가능하게 한다.
  • 시간 단계에 따라 변하는 신원 손실을 제안하여 확산 샘플링 단계 전반에 걸쳐 신원 일관성을 유지함으로써 생성된 이미지가 원본 주제의 신원을 유지하도록 한다.
  • 교차 조건 트리플릿을 확보하기 어려운 점을 감안해, 동일 주제의 실데이터(신원, 스타일) 쌍만을 사용해 이중 조건 생성기를 훈련함.
  • 다양한 스타일 이미지를 포함한 스타일 백업을 활용해 대규모 스타일 변동성을 확보하면서도 신원 충실도를 유지함.
  • 합성 데이터의 레이블 일관성이 낮은 점을 보완하기 위해 훈련 중 레이블 오버샘플링을 적용함으로써 모델 일반화 성능 향상.

실험 결과

연구 질문

  • RQ1확산 기반 모델이 신원과 스타일에 조건을 두어 다양한, 신원 일관성 있는 얼굴 이미지를 효과적으로 생성할 수 있는가?
  • RQ2신원과 스타일을 별도로 제어하는 것이 기존 GAN 또는 3D 기반 방법에 비해 합성 얼굴 데이터셋의 품질과 다양성에 어떤 영향을 미치는가?
  • RQ3합성 데이터로만 훈련된 얼굴 인식 모델이 실데이터로 훈련된 모델의 성능에 얼마나 가까이 도달할 수 있는가?
  • RQ4제안된 이중 조건 생성 프레임워크는 합성 데이터와 실데이터 간 성능 격차를 어떻게 줄이는가?
  • RQ5합성 얼굴 생성에서 레이블 일관성, 스타일 다양성, 신원 충실도 간의 상충 관계는 어떤가?

주요 결과

  • DCFacer가 생성한 합성 데이터셋은 LFW, CFP-FP, CPLFW, AgeDB, CALFW 등 다섯 개의 벤치마크 데이터셋 중 네 개에서 이전 최고 성능 방법 대비 평균 6.11% 높은 정확도를 달성한다.
  • 0.5M 이미지 설정에서 DCFace는 이전 SoTA 대비 실데이터와의 성능 격차를 57% 감소시켰으며, 합성-실데이터 정확도 격차는 4.14%로 줄었다.
  • 1.2M 이미지 설정에서는 격차가 3.74%로 더욱 감소하여 이전 방법 대비 60.9% 향상되었으며, 이는 9.55% 격차에서의 개선이다.
  • 모델은 20,000개의 고유한 신원을 기반으로 100만 개 이상의 이미지를 생성하였으며, 각 신원당 평균 50개의 다양한 스타일 변형을 제공함으로써 높은 확장성과 다양성을 입증했다.
  • 시간 단계에 따라 변하는 신원 손실과 패치 단위 스타일 추출기가 신원 일관성과 스타일 분리 성능 향상에 기여함을 아블레이션 연구를 통해 검증했다.
  • 훈련 중 레이블 오버샘플링은 무작위 샘플링 대비 성능을 0.52% 향상시켰으며, 합성 데이터의 낮은 레이블 일관성 보완의 유용성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.