Skip to main content
QUICK REVIEW

[论文解读] Nepotistically Trained Generative-AI Models Collapse

Matyáš Boháček, Hany Farid|arXiv (Cornell University)|Nov 20, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文表明,一种流行的文生图扩散模型Stable Diffusion在仅用其自身生成图像的3%进行微调时,会出现严重的模型崩溃。模型的图像质量和多样性迅速下降,即使后续在真实数据上重新训练也难以完全恢复,揭示了其在自生成内容导致的数据投毒攻击下存在关键脆弱性。

ABSTRACT

Trained on massive amounts of human-generated content, AI-generated image synthesis is capable of reproducing semantically coherent images that match the visual appearance of its training data. We show that when retrained on even small amounts of their own creation, these generative-AI models produce highly distorted images. We also show that this distortion extends beyond the text prompts used in retraining, and that once affected, the models struggle to fully heal even after retraining on only real images.

研究动机与目标

  • 研究微调生成式AI模型时使用其自身合成输出的影响,这一现象被称为‘模型投毒’。
  • 评估自生成数据是否会导致基于扩散的模型(如Stable Diffusion)在图像质量和多样性方面出现不可逆退化。
  • 评估在真实图像上重新训练以‘修复’先前被合成数据投毒的模型的有效性。
  • 检验对自生成数据进行色彩匹配或质量筛选是否能缓解崩溃效应。
  • 探讨在AI训练数据溯源和模型鲁棒性背景下,数据投毒的更广泛影响。

提出的方法

  • 在包含不同比例真实人脸(来自FFHQ)和自生成人脸的混合数据集上,迭代微调基础Stable Diffusion模型。
  • 采用固定每轮训练步数的迭代微调策略,对每个混合数据批次更新模型。
  • 在YCbCr空间中应用直方图匹配,以对齐生成图像与真实图像的色彩分布,减少基于色彩的干扰因素。
  • 利用单张图像FID分数筛选低质量生成图像,在重新训练前用更高质的合成样本替代。
  • 使用Fréchet Inception Distance(FID)和CLIP分数评估模型性能,分别衡量图像质量和语义对齐程度。
  • 通过使用筛选后数据的对照实验,隔离图像质量与色彩分布对模型崩溃的影响。
Figure 3: Shown is the Fréchet inception distance (FID) and contrastive language-image pre-training score (CLIP) as a function of the number of retraining iterations and the composition of the retraining dataset ranging from $100\%$ SD-generated faces and $0\%$ real faces to $0\%$ SD-generated and $
Figure 3: Shown is the Fréchet inception distance (FID) and contrastive language-image pre-training score (CLIP) as a function of the number of retraining iterations and the composition of the retraining dataset ranging from $100\%$ SD-generated faces and $0\%$ real faces to $0\%$ SD-generated and $

实验结果

研究问题

  • RQ1当Stable Diffusion在仅使用其自身生成图像的极小比例(如3%)进行微调时,其图像质量和多样性会发生什么变化?
  • RQ2即使在仅使用真实图像进行微调后,模型崩溃是否仍然持续存在,表明损伤不可逆?
  • RQ3预处理技术(如色彩匹配或质量筛选)能否预防或延迟模型崩溃?
  • RQ4这种投毒效应在多大程度上会超出微调期间使用的特定文本提示范围?
  • RQ5这种崩溃现象在不同生成式AI模型和不同训练数据构成下具有多大程度的泛化性?

主要发现

  • 当Stable Diffusion在仅3%的自生成图像上进行微调时,模型崩溃迅速发生,到第五轮微调迭代时,图像质量已显著下降。
  • 即使在仅真实图像上再进行五轮额外微调,模型仍无法恢复,表明损伤具有持久性且修复能力有限。
  • 所有投毒比例下FID分数均上升,CLIP分数均下降,其中100%自生成数据时退化最为严重。
  • 使用色彩匹配和高质量筛选数据的对照实验仍导致模型崩溃,且崩溃速率相同,表明色彩和质量差异并非根本原因。
  • 投毒效应不仅影响微调期间使用的原始提示,还扩展至无关文本提示的模型输出,表明存在广泛的分布偏移。
  • 模型在首次微调迭代后图像质量出现短暂小幅提升,随后持续退化,表明在崩溃前存在短暂的优化阶段。
Nepotistically Trained Generative-AI Models Collapse

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。