[论文解读] Mitigating Inappropriateness in Image Generation: Can there be Value in Reflecting the World's Ugliness?
本文研究了在文本到图像扩散模型中使用显式文本指令——具体为语义引导(SEGA)和负面提示——以减轻不当图像生成的问题。通过利用模型对‘世界丑陋’的内在表征,作者证明这些推理时干预措施能显著降低在11个开源模型中生成不当内容的可能性,其中SEGA在抑制不当输出方面比负面提示更为有效。
Text-conditioned image generation models have recently achieved astonishing results in image quality and text alignment and are consequently employed in a fast-growing number of applications. Since they are highly data-driven, relying on billion-sized datasets randomly scraped from the web, they also reproduce inappropriate human behavior. Specifically, we demonstrate inappropriate degeneration on a large-scale for various generative text-to-image models, thus motivating the need for monitoring and moderating them at deployment. To this end, we evaluate mitigation strategies at inference to suppress the generation of inappropriate content. Our findings show that we can use models' representations of the world's ugliness to align them with human preferences.
研究动机与目标
- 系统评估当前最先进的文本到图像扩散模型在生成不当内容方面的严重程度。
- 评估推理时指令方法——特别是SEGA与负面提示——在抑制此类内容方面的有效性。
- 为安全缓解策略在多样化模型与架构之间提供大规模、可量化的基准。
- 探索是否可利用模型内部对‘丑陋’的表征来对齐生成结果与人类偏好。
- 提供一种灵活且可部署的现实世界内容审核解决方案,避免高昂的微调或数据过滤成本。
提出的方法
- 作者采用大规模评估框架,在11个开源文本到图像模型上生成超过150万张图像。
- 应用两种基于指令的缓解策略:语义引导(SEGA),通过添加引导项来引导生成远离不希望的概念;以及负面提示,通过在无条件去噪步骤中引入抑制提示来实现条件化。
- 使用I2P(不当图像提示)数据集对模型进行提示,以测试其生成不当内容的能力。
- 通过组合Q16/NudeNet分类器对不当内容进行分类,以衡量概率和预期最大不当程度。
- 采用无分类器指导作为底层机制,实现在无需外部分类器的情况下的条件生成。
- 评估包括对每个模型的25个提示进行预期最大不当程度的自举估计。

实验结果
研究问题
- RQ1当使用模糊或明确的提示时,当前的文本到图像扩散模型在多大程度上会生成不当内容?
- RQ2SEGA与负面提示是否能有效减少在多样化模型与架构中生成的不当图像?
- RQ3在缓解效果与内容抑制控制方面,SEGA与负面提示相比表现如何?
- RQ4是否可以利用模型内部对‘丑陋’的表征来对齐图像生成与人类安全偏好?
- RQ5在现实世界部署场景中,基于指令的缓解策略在可扩展性与泛化能力方面表现如何?
主要发现
- 研究证明,不当内容生成是11个开源文本到图像模型中的普遍问题,即使使用非明确提示,生成不当图像的概率也极高。
- SEGA显著降低了生成不当内容的概率,在性相关及所有类别不当内容的抑制上均优于负面提示。
- 使用SEGA后,预期最大不当程度显著下降,表明每组提示中至少生成一次具有攻击性图像的可能性大幅降低。
- 负面提示同样能减少不当内容,但控制力较弱,且在抑制微妙或隐含形式的不当内容方面效果不如SEGA。
- 结果表明,推理时基于指令的缓解策略是数据过滤或微调的可扩展且灵活的替代方案,计算开销极低。
- 组合Q16/NudeNet分类器提供了一个保守基线,表明实际不当程度可能被低估,但缓解效果的趋势依然稳健。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。