Skip to main content
QUICK REVIEW

[论文解读] Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image Synthesis

Lukas Struppek, Dominik Hintersdorf|arXiv (Cornell University)|Nov 4, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文首次针对文本到图像生成模型(如 Stable Diffusion)中的文本编码器提出了后门攻击,通过微调预训练的 CLIP 编码器,使其在提示中出现特定不显眼的触发器(如相似字符或表情符号)时生成恶意图像。该攻击在两分钟内即可完成,成功率极高,可强制模型生成具有预设属性的图像,或遗忘特定概念,揭示了广泛使用的 AI 组件中存在严重安全风险。

ABSTRACT

While text-to-image synthesis currently enjoys great popularity among researchers and the general public, the security of these models has been neglected so far. Many text-guided image generation models rely on pre-trained text encoders from external sources, and their users trust that the retrieved models will behave as promised. Unfortunately, this might not be the case. We introduce backdoor attacks against text-guided generative models and demonstrate that their text encoders pose a major tampering risk. Our attacks only slightly alter an encoder so that no suspicious model behavior is apparent for image generations with clean prompts. By then inserting a single character trigger into the prompt, e.g., a non-Latin character or emoji, the adversary can trigger the model to either generate images with pre-defined attributes or images following a hidden, potentially malicious description. We empirically demonstrate the high effectiveness of our attacks on Stable Diffusion and highlight that the injection process of a single backdoor takes less than two minutes. Besides phrasing our approach solely as an attack, it can also force an encoder to forget phrases related to certain concepts, such as nudity or violence, and help to make image generation safer.

研究动机与目标

  • 揭示预训练文本编码器在文本到图像模型(尤其是 Stable Diffusion 等系统)中的安全漏洞。
  • 证明后门攻击可仅通过微小改动隐蔽地注入文本编码器,且在正常使用中难以被检测。
  • 表明此类攻击可被用于强制模型按指令生成偏见性或有害内容,甚至压制特定概念(如裸体)。
  • 强调该技术亦可被用于安全目的,即通过训练编码器遗忘特定不良概念。
  • 呼吁 AI 社区正视第三方模型组件的风险,并开发稳健的检测与缓解策略。

提出的方法

  • 使用少量精心挑选的数据集微调预训练的 CLIP 文本编码器,以嵌入后门,将特定触发器与目标输出关联。
  • 使用同形异义字符(如西里尔字母 'о' 代替拉丁字母 'o')或表情符号作为视觉上不显眼的触发器,难以被用户察觉。
  • 在触发器出现在输入提示时,训练模型生成与目标提示匹配的图像,同时在干净提示下保持正常行为。
  • 通过修改文本编码器的分类头和注意力层来注入后门,而无需改动扩散模型。
  • 通过生成图像与目标提示之间的余弦相似度评估攻击成功率,确保图像保真度和触发器可靠性。
  • 展示双重用途潜力:不仅可用于恶意劫持,还可通过训练编码器遗忘特定概念来实现内容安全化。

实验结果

研究问题

  • RQ1是否可以在不降低正常性能的前提下,成功将后门攻击注入用于文本到图像合成的预训练文本编码器?
  • RQ2不显眼的触发器(如同形异义字符或表情符号)在隐蔽地劫持图像生成行为方面有多高效?
  • RQ3后门攻击在多大程度上可被用于操纵图像属性或强制生成特定内容(包括有害材料)?
  • RQ4相同的后门机制是否可用于抑制或遗忘特定概念(如裸体)在图像生成中的出现,从而提升安全性?
  • RQ5此类后门的注入速度和效率如何?对模型质量与用户信任有何影响?

主要发现

  • 当触发器存在时,后门攻击的触发成功率超过 90%,由生成图像与目标提示之间的高余弦相似度得分证实。
  • 注入过程耗时不足两分钟,证明了此类攻击在实际应用中的可行性与低成本。
  • 在使用干净提示进行正常推理时,攻击保持隐蔽,图像质量和连贯性均未受影响。
  • 该方法在同形异义字符和表情符号作为触发器时均表现可靠,表明其在不同类型输入中具有广泛适用性。
  • 相同技术可用于训练编码器遗忘特定概念(如裸体),方法是将目标设为空字符串,暗示其潜在的安全应用价值。
  • 攻击可将命名实体(如政治人物)重新映射为其他身份,同时保持图像质量,证明其具备注入细微语义偏见的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。