Skip to main content
QUICK REVIEW

[论文解读] DCFace: Synthetic Face Generation with Dual Condition Diffusion Model

Minchul Kim, Feng Liu|arXiv (Cornell University)|Apr 14, 2023
Face recognition and analysis被引用 4
一句话总结

本文提出 DCFace,一种双条件扩散模型,通过分别控制身份(ID)和风格(如姿态、光照、表情),生成高保真度的合成人脸图像,实现在多种风格下对同一主体的一致性多图生成。在 DCFace 生成的数据上进行训练的人脸识别模型,在五个基准数据集中的四个上相比先前方法平均准确率提升 6.11%,显著缩小了与真实数据训练的性能差距。

ABSTRACT

Generating synthetic datasets for training face recognition models is challenging because dataset generation entails more than creating high fidelity images. It involves generating multiple images of same subjects under different factors ( extit{e.g.}, variations in pose, illumination, expression, aging and occlusion) which follows the real image conditional distribution. Previous works have studied the generation of synthetic datasets using GAN or 3D models. In this work, we approach the problem from the aspect of combining subject appearance (ID) and external factor (style) conditions. These two conditions provide a direct way to control the inter-class and intra-class variations. To this end, we propose a Dual Condition Face Generator (DCFace) based on a diffusion model. Our novel Patch-wise style extractor and Time-step dependent ID loss enables DCFace to consistently produce face images of the same subject under different styles with precise control. Face recognition models trained on synthetic images from the proposed DCFace provide higher verification accuracies compared to previous works by $6.11\%$ on average in $4$ out of $5$ test datasets, LFW, CFP-FP, CPLFW, AgeDB and CALFW. Code is available at https://github.com/mk-minchul/dcface

研究动机与目标

  • 解决为训练人脸识别模型而生成大规模、标签一致且多样化的合成人脸数据集的挑战。
  • 通过在图像生成中联合控制身份和风格因素,改进现有的基于 GAN 或 3D 模型的方法。
  • 仅使用合成数据实现高性能人脸识别,减少对隐私敏感的网络爬取数据集的依赖。
  • 在合成数据中平衡类间差异(多样化身份)、类内差异(每个身份的多种风格)和标签一致性。
  • 缩小人脸识别基准中合成数据与真实数据之间的性能差距。

提出的方法

  • 采用两阶段生成框架:首先,使用扩散模型生成高质量的特定身份人脸图像;其次,通过双条件生成器将这些图像与来自风格库的风格图像混合。
  • 引入一种基于图像块的风格提取器,将风格信息(姿态、光照、表情)从身份中解耦,实现细粒度的风格控制。
  • 提出一种时间步依赖的身份损失,以在扩散采样过程中保持身份一致性,确保生成图像保留源主体的身份特征。
  • 仅使用来自同一主体的真实(身份,风格)配对进行双条件生成器的训练,避免了难以获取的跨条件三元组。
  • 利用包含多样化风格图像的风格库,实现在保持身份保真度的同时实现大规模风格变化。
  • 在训练过程中应用标签过采样,以补偿合成数据中较低的标签一致性,提升模型泛化能力。

实验结果

研究问题

  • RQ1基于扩散模型的生成方法能否通过同时条件化身份和风格,有效生成多样化且身份一致的人脸图像?
  • RQ2与先前基于 GAN 或 3D 的方法相比,分别控制身份和风格在多大程度上提升了合成人脸数据集的质量与多样性?
  • RQ3仅使用合成数据训练的人脸识别模型,在多大程度上可以达到与使用真实数据训练的模型相当的性能?
  • RQ4所提出的双条件生成框架在多大程度上减少了合成数据与真实数据训练之间的性能差距?
  • RQ5在合成人脸生成中,标签一致性、风格多样性和身份保真度之间存在何种权衡?

主要发现

  • DCFace 生成的合成数据集在五个基准数据集中的四个(LFW、CFP-FP、CPLFW、AgeDB、CALFW)上,相比先前最先进方法,平均验证准确率提升 6.11%。
  • 在 0.5M 图像设置下,DCFace 相比先前 SOTA 方法将与真实数据的性能差距缩小了 57%,合成数据与真实数据之间的准确率差距为 4.14%。
  • 在 1.2M 图像设置下,与真实数据的差距进一步缩小至 3.74%,相比先前方法(9.55% 的差距)提升了 60.9%。
  • 该模型生成超过一百万张图像,涵盖两万个唯一身份,每个身份拥有 50 种多样的风格变化,展现出高度的可扩展性与多样性。
  • 时间步依赖的身份损失和基于图像块的风格提取器在消融实验中显著提升了身份一致性和风格解耦效果。
  • 训练过程中采用标签过采样相比随机采样使性能提升 0.52%,证实了补偿合成数据较低标签一致性具有实际效益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。