[论文解读] Towards Safe Self-Distillation of Internet-Scale Text-to-Image Diffusion Models
本文提出安全自蒸馏扩散(sdd),一种通过自蒸馏微调文本到图像扩散模型的方法,以去除有害或受版权保护的内容(如裸露或特定艺术家风格)——通过将目标概念的噪声预测与无条件模型的输出对齐。sdd 能够同时有效去除多种概念,同时保持图像质量,在安全性和保真度方面优于先前的方法。
Large-scale image generation models, with impressive quality made possible by the vast amount of data available on the Internet, raise social concerns that these models may generate harmful or copyrighted content. The biases and harmfulness arise throughout the entire training process and are hard to completely remove, which have become significant hurdles to the safe deployment of these models. In this paper, we propose a method called SDD to prevent problematic content generation in text-to-image diffusion models. We self-distill the diffusion model to guide the noise estimate conditioned on the target removal concept to match the unconditional one. Compared to the previous methods, our method eliminates a much greater proportion of harmful content from the generated images without degrading the overall image quality. Furthermore, our method allows the removal of multiple concepts at once, whereas previous works are limited to removing a single concept at a time.
研究动机与目标
- 解决互联网规模文本到图像扩散模型中生成有害和受版权保护内容的挑战。
- 开发一种在不降低图像质量或导致灾难性遗忘的情况下移除问题概念的方法。
- 实现在单次微调过程中同时移除多个有害或受版权保护的概念,克服先前单概念方法的局限性。
- 为生成模型在现实世界中的部署提供一种安全、高效且可部署的微调后解决方案。
提出的方法
- 该方法通过训练学生模型以匹配目标概念的无条件噪声预测来执行自蒸馏,使用文本提示引导蒸馏过程。
- 采用指数移动平均(EMA)教师模型以稳定训练并减轻微调过程中的灾难性遗忘。
- 学生模型在条件为特定目标概念提示时,优化潜空间中的噪声预测,同时使其输出与 EMA 教师模型的无条件预测对齐。
- 该方法应用于预训练之后,无需访问原始训练数据,因此适用于部署环境中的模型微调。
- 通过顺序或联合应用蒸馏过程到多个目标概念,该方法支持多概念移除。
- 训练目标最小化学生模型的噪声预测与 EMA 教师模型无条件预测之间的 L2 距离,确保对齐且不过拟合。
实验结果
研究问题
- RQ1自蒸馏能否在不降低图像质量的前提下有效去除文本到图像扩散模型中的有害内容?
- RQ2与现有去毒技术相比,该方法在安全性和保真度方面表现如何?
- RQ3该方法能否在单次微调过程中同时移除多个有害或受版权保护的概念(如裸露和艺术家风格)?
- RQ4使用 EMA 教师模型在概念移除过程中在多大程度上防止了灾难性遗忘?
- RQ5该方法在微调后是否仍能保持模型为无关提示生成多样化且高质量图像的能力?
主要发现
- sdd 将基础 Stable Diffusion 模型在 5,000 张图像基准测试中 NSFW(裸露)图像的比例从 74.18% 降低至 12.62%,显著优于现有方法。
- 该方法保持了高图像质量,FID 得分为 15.142,与 esd 和 sld 等其他方法相比相当或更优。
- sdd 有效从生成图像中移除了特定艺术家风格(如梵高的风格),同时保留了提示的核心内容和艺术意图。
- 与 sd+neg 或 sld 等单概念方法不同,sdd 在同时移除多个概念时仍保持强劲性能,避免了其他方法中常见的性能下降。
- EMA 教师模型有效保留了通用知识,并在移除多个概念时防止了图像质量的退化。
- 该方法展示了稳定且快速的训练过程,不同概念在蒸馏过程中相互干扰极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。