Skip to main content
QUICK REVIEW

[论文解读] Synthetic Face Datasets Generation via Latent Space Exploration from Brownian Identity Diffusion

David Geissbühler, Hatef Otroshi Shahreza|arXiv (Cornell University)|Apr 30, 2024
Face recognition and analysis被引用 4
一句话总结

该论文提出一种受物理启发的方法,通过将潜在空间采样建模为在随机力作用下的软粒子布朗运动,生成多样化、高质量的合成人脸数据集。采用Langevin、Dispersion和DisCo三种算法,该方法在AgeDB数据集(30,000个身份)上实现了88.40%的平均识别准确率,达到当前最优水平,同时最小化了身份泄露,优于基于GAN的合成数据集,与基于扩散的方法相当。

ABSTRACT

Face recognition models are trained on large-scale datasets, which have privacy and ethical concerns. Lately, the use of synthetic data to complement or replace genuine data for the training of face recognition models has been proposed. While promising results have been obtained, it still remains unclear if generative models can yield diverse enough data for such tasks. In this work, we introduce a new method, inspired by the physical motion of soft particles subjected to stochastic Brownian forces, allowing us to sample identities distributions in a latent space under various constraints. We introduce three complementary algorithms, called Langevin, Dispersion, and DisCo, aimed at generating large synthetic face datasets. With this in hands, we generate several face datasets and benchmark them by training face recognition models, showing that data generated with our method exceeds the performance of previously GAN-based datasets and achieves competitive performance with state-of-the-art diffusion-based synthetic datasets. While diffusion models are shown to memorize training data, we prevent leakage in our new synthetic datasets, paving the way for more responsible synthetic datasets.

研究动机与目标

  • 为解决真实世界人脸识别数据集中存在的隐私与伦理问题,提出生成合成替代数据集。
  • 开发一种方法,在最小化训练数据记忆化的同时,确保合成人脸数据的高多样性与真实感。
  • 通过受物理启发的潜在空间动力学,实现对合成身份之间类间与类内差异的精确控制。
  • 在人脸识别性能上,将合成数据集与当前最优方法进行基准对比。
  • 减少合成数据中的身份泄露,确保数据生成过程的负责任与合伦理。

提出的方法

  • 该方法将合成身份建模为潜在空间中受排斥力、布朗运动和吸引力势能作用的软球形粒子,灵感源自朗之万方程。
  • Langevin算法通过最小化不同合成身份之间的嵌入距离,同时保持潜在空间中的分布扩散,优化类间分布。
  • Dispersion算法通过施加随机力扰动潜在码,生成类内差异,保持身份一致性的同时引入多样性。
  • DisCo算法利用预计算的潜在方向增强类内差异,实现可控的、高保真度的图像生成。
  • 采用混合损失函数,结合身份级排斥(L_E)、权重正则化(L_W)和真实-合成排斥(L_E_tr),以防止数据泄露。
  • 通过在生成的数据集上训练人脸识别模型,并在标准基准(LFW、CPLFW、AgeDB等)上评估性能,验证该方法。

实验结果

研究问题

  • RQ1受物理启发的潜在空间动力学能否生成足够多样且逼真的合成人脸数据集,以用于训练人脸识别模型?
  • RQ2与基于GAN和基于扩散的合成数据集相比,该方法在人脸识别准确率和身份泄露方面表现如何?
  • RQ3Langevin、Dispersion和DisCo算法在控制合成人脸数据中类间与类内差异方面,能达到何种程度的控制力?
  • RQ4引入真实-合成嵌入排斥项(dE_tr)是否能有效减少生成数据集中的身份泄露?
  • RQ5在使用合成数据进行人脸识别时,达到最佳性能的最优规模(身份数量与变体数量)是多少?

主要发现

  • 使用DisCo算法,30,000个身份、每个身份64种变体时,该方法在AgeDB基准上实现了88.40%的平均人脸识别准确率,接近当前最优的基于扩散的方法性能。
  • 该方法优于先前提出的基于GAN的合成数据集,展现出更优的泛化能力与多样性。
  • 将真实-合成嵌入排斥距离(dE_tr)从0提升至1.3,人脸识别准确率略有提升,表明泛化能力得到改善。
  • 出人意料的是,将变体数量从64增加至128导致性能显著下降(例如,平均准确率降至69.32%),表明存在过拟合或质量退化现象。
  • 对最相似的真实与合成图像对进行视觉检查显示,该方法中身份泄露极小,而DCFace则表现出对训练样本的强烈记忆化现象。
  • 通过引入参考集成来组合数据集仅带来微小的性能增益,表明核心算法在大规模下已具备足够有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。