Skip to main content
QUICK REVIEW

[论文解读] On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts

Yixin Wu, Ning Yu|arXiv (Cornell University)|Oct 25, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出了首个针对文本到图像模型的主动中毒攻击,通过使用良性提示生成不安全、带有仇恨情绪的类表情包图像。通过使用语义上相似的提示对模型进行中毒,该攻击仅需五组样本即可实现高成功率,但因语义相似性导致了意外的副作用;一种保持实用性的变体通过清洗非目标提示,将FID分数的增加减少了高达82.47%。

ABSTRACT

Malicious or manipulated prompts are known to exploit text-to-image models to generate unsafe images. Existing studies, however, focus on the passive exploitation of such harmful capabilities. In this paper, we investigate the proactive generation of unsafe images from benign prompts (e.g., a photo of a cat) through maliciously modified text-to-image models. Our preliminary investigation demonstrates that poisoning attacks are a viable method to achieve this goal but uncovers significant side effects, where unintended spread to non-targeted prompts compromises attack stealthiness. Root cause analysis identifies conceptual similarity as an important contributing factor to these side effects. To address this, we propose a stealthy poisoning attack method that balances covertness and performance. Our findings highlight the potential risks of adopting text-to-image models in real-world scenarios, thereby calling for future research and safety measures in this space.

研究动机与目标

  • 调查文本到图像模型是否可被主动操控,仅通过良性提示生成不安全图像,而非依赖被动的提示操纵。
  • 解决因语义相似性导致中毒影响非目标提示而引发的意外副作用风险。
  • 开发一种保持实用性的攻击方法,在维持攻击有效性的同时最小化模型实用性的退化。
  • 为识别和清洗语义上相似的提示提供可操作的见解,以减少中毒攻击中的副作用。

提出的方法

  • 提出一种基础的中毒攻击方法,通过在少量良性提示与目标仇恨表情包图像配对的数据集上训练文本到图像模型,诱导其生成不安全图像。
  • 引入一种保持实用性的攻击方法,通过将非目标提示替换为语义相似但无害的变体,以减少副作用。
  • 使用Fréchet Inception Distance(FID)定量评估模型实用性,并测量中毒导致的退化程度。
  • 进行根本原因分析,确认目标提示与非目标提示之间的语义相似性是副作用传播的主要驱动因素。
  • 应用“捷径”提示提取策略,识别能以更少中毒样本触发攻击的高影响力提示。
  • 利用MSCOCO验证集评估在多样化非目标提示下的副作用与实用性保持效果。
Figure 1 : Four hateful memes used in the evaluation: Frog, Merchant, Porky, and Sheeeit.
Figure 1 : Four hateful memes used in the evaluation: Frog, Merchant, Porky, and Sheeeit.

实验结果

研究问题

  • RQ1能否仅通过良性提示主动对文本到图像模型进行中毒,以生成不安全图像?
  • RQ2哪些因素导致非目标提示也触发不安全图像生成的意外副作用?
  • RQ3在保持攻击成功率的前提下,保持实用性的提示清洗能在多大程度上减少副作用?
  • RQ4提示之间的语义相似性如何影响中毒效应的传播?
  • RQ5是否能使用极少数中毒样本(例如五组)实现有效的攻击性能?

主要发现

  • 基础中毒攻击仅需五组中毒样本即可实现目标仇恨表情包的生成,表明文本到图像模型存在高度脆弱性。
  • 该攻击导致显著副作用,非目标提示也因提示间的语义相似性而生成不安全图像。
  • 根本原因分析确认,目标提示与非目标提示之间的语义相似性是副作用传播的主要因素。
  • 与基础攻击相比,保持实用性的攻击将FID分数的增加减少了高达82.47%,尤其在涉及“Happy Merchant”表情包的最坏情况中效果显著。
  • “捷径”提示提取策略通过识别能高效触发目标行为的高影响力提示,使攻击在更少样本下成功。
  • 清洗单个语义上相似的提示即可减少对多个非目标提示的副作用,表明语义相似性在中毒传播中具有显著影响。
Figure 2 : Overview of the basic attack.
Figure 2 : Overview of the basic attack.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。