Skip to main content
QUICK REVIEW

[论文解读] Real-Fake: Effective Training Data Synthesis Through Distribution Matching

Jianhao Yuan, Jie Zhang|arXiv (Cornell University)|Oct 16, 2023
Advanced Neural Network Applications被引用 5
一句话总结

本文提出 Real-Fake,一种基于文本到图像扩散模型的合成训练数据生成的原理性分布匹配框架。通过优化训练目标和条件生成,将合成数据分布与真实数据对齐,实现了最先进性能——在分布外泛化能力上超越真实数据,并实现最小化记忆化的隐私保护学习。

ABSTRACT

Synthetic training data has gained prominence in numerous learning tasks and scenarios, offering advantages such as dataset augmentation, generalization evaluation, and privacy preservation. Despite these benefits, the efficiency of synthetic data generated by current methodologies remains inferior when training advanced deep models exclusively, limiting its practical utility. To address this challenge, we analyze the principles underlying training data synthesis for supervised learning and elucidate a principled theoretical framework from the distribution-matching perspective that explicates the mechanisms governing synthesis efficacy. Through extensive experiments, we demonstrate the effectiveness of our synthetic data across diverse image classification tasks, both as a replacement for and augmentation to real datasets, while also benefits such as out-of-distribution generalization, privacy preservation, and scalability. Specifically, we achieve 70.9% top1 classification accuracy on ImageNet1K when training solely with synthetic data equivalent to 1 X the original real data size, which increases to 76.0% when scaling up to 10 X synthetic data.

研究动机与目标

  • 解决监督学习中基于合成数据与真实数据训练的模型之间持续存在的性能差距。
  • 克服提示工程和基于反演的方法等启发式方法在合成数据质量上的局限性。
  • 构建一个理论基础扎实的框架,以解释并提升合成训练数据的有效性。
  • 证明合成数据可在分布外泛化方面超越真实数据,并提供强隐私保障。
  • 建立一个可扩展、原理清晰的流水线,用于生成高保真度、分布对齐的图像分类任务合成训练数据。

提出的方法

  • 将训练数据合成重新定义为分布匹配问题,强调两个核心原则:真实数据与合成数据之间的分布差异,以及训练集基数。
  • 以 Stable Diffusion 扩散模型作为骨干网络,通过系统性地优化训练目标、条件控制和先验初始化,提升分布对齐效果。
  • 通过 CLIP 编码器在特征层面实现对齐,利用分布匹配技术引导合成数据生成以匹配真实数据的特征分布。
  • 采用多阶段训练与评估协议,包括对各组件贡献的消融研究以及在不同数据规模下的缩放规律分析。
  • 集成成员推理攻击(LiRA)和自监督内容重复检测(SSCD)以评估隐私和记忆风险。
  • 通过在成员数据上进行 LoRA 微调生成合成数据以进行隐私评估,确保数据泄露最小化。
(a) Distribution Visualization
(a) Distribution Visualization

实验结果

研究问题

  • RQ1如何系统性地改进合成训练数据,使其在图像分类任务中达到与真实数据相当的性能?
  • RQ2哪些理论原则决定了合成数据的有效性,特别是关于分布对齐与数据规模方面?
  • RQ3合成数据是否能在分布外泛化方面超越真实数据?在何种条件下可以实现?
  • RQ4合成数据在多大程度上保持了隐私?这种隐私保护程度如何进行定量衡量?
  • RQ5扩散模型中组件级优化(如条件控制、目标函数、先验)对最终分布对齐和模型性能有何影响?

主要发现

  • 仅使用 1× 合成数据训练 ResNet50 在 ImageNet1k 上达到 70.9% 的 Top-1 准确率,使用 10× 合成数据时提升至 76.0%,接近真实数据性能。
  • 与真实数据联合训练时,Real-Fake 合成数据提升了分布外泛化能力,在 ImageNet-R 和 ImageNet-A 上的性能甚至在分布内性能匹配前已超越真实数据。
  • 在 ImageNet-R 基准上,5× 合成数据达到 56.3% 的准确率,超过使用相同模型和数据规模的真实数据的 54.1%。
  • 成员推理攻击(LiRA)在使用合成数据训练的模型上,于 0.1% 的假阳性率下仅达到 0.001% 的真正例率,而真实数据模型为 0.01%,表明隐私保护更强。
  • 基于 SSCD 的视觉相似性分析未发现记忆化或复制现象,合成查询对应的前 3 名检索真实图像未显示视觉重复。
  • 随着合成数据规模扩大,所有基准上的性能均持续提升,表明具有有利的缩放规律,并对数据规模增加具有鲁棒性。
(b) Baseline Comparison
(b) Baseline Comparison

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。