[论文解读] Evaluating the Robustness of Text-to-image Diffusion Models against Real-world Attacks
本文提出了首个针对文本到图像扩散模型的黑箱对抗攻击框架,使用真实、类人的输入扰动(如拼写错误、字形替换和音似错误)来实现攻击,同时保持语义一致性。通过利用基于分布的攻击目标和贪婪搜索,该方法在极低查询次数和扰动率下实现了高成功率,暴露了Stable Diffusion和DALL-E 2等模型存在的显著鲁棒性漏洞。
Text-to-image (T2I) diffusion models (DMs) have shown promise in generating high-quality images from textual descriptions. The real-world applications of these models require particular attention to their safety and fidelity, but this has not been sufficiently explored. One fundamental question is whether existing T2I DMs are robust against variations over input texts. To answer it, this work provides the first robustness evaluation of T2I DMs against real-world attacks. Unlike prior studies that focus on malicious attacks involving apocryphal alterations to the input texts, we consider an attack space spanned by realistic errors (e.g., typo, glyph, phonetic) that humans can make, to ensure semantic consistency. Given the inherent randomness of the generation process, we develop novel distribution-based attack objectives to mislead T2I DMs. We perform attacks in a black-box manner without any knowledge of the model. Extensive experiments demonstrate the effectiveness of our method for attacking popular T2I DMs and simultaneously reveal their non-trivial robustness issues. Moreover, we provide an in-depth analysis of our method to show that it is not designed to attack the text encoder in T2I DMs solely.
研究动机与目标
- 评估文本到图像扩散模型在真实、人为生成的输入错误(如拼写错误、字形替换和音似变化)下的鲁棒性。
- 开发一种无需模型架构或权重知识的黑箱攻击方法,重点关注扰动中的语义一致性。
- 探究攻击主要针对文本编码器,还是也影响扩散过程本身。
- 展示基于分布的攻击目标在极小扰动和查询次数下误导图像生成的有效性。
提出的方法
- 提出一种基于贪婪搜索的黑箱攻击框架,通过分析关键词对生成分布的边际影响,识别并修改输入提示中的高影响力关键词。
- 采用新颖的基于分布的攻击目标——具体为2ST和MMD距离——以使生成图像与原始文本描述产生错位。
- 应用符合三种真实规则的字符级扰动:拼写错误(Levenshtein距离 ≤3)、字形替换(视觉上相似的字符)和音似替换(同音或音近词语)。
- 通过仅针对单个词语并最小化真实查询次数(不包括句子长度)实现查询高效的优化,从而实现隐蔽攻击。
- 在多个数据集(包括ChatGPT-GP、LAION-COCO、DiffusionDB和SBU语料库)上验证攻击效果,并通过人工评估确保语义一致性。
- 分析在Stable Diffusion和DALL-E 2等模型上的攻击效果,确认攻击不仅作用于文本编码器,也影响扩散过程本身。
实验结果
研究问题
- RQ1真实、类人的文本扰动(如拼写错误、音似错误)是否能在保持语义一致的前提下有效误导文本到图像扩散模型?
- RQ2在黑箱约束下,基于分布的攻击目标(如2ST、MMD)在降低文本到图像相似度方面的有效性如何?
- RQ3该攻击主要利用文本编码器,还是也影响扩散过程本身?
- RQ4在现实环境中,实现高攻击成功率所需的最小扰动率和查询次数是多少?
主要发现
- 在所有数据集上,文本-图像相似度(S_I2T)均下降超过4分,人工评估的成功率超过80%。
- 平均而言,该方法仅需不到10次真实查询次数即可实现显著的S_I2T下降,展现出极高的查询效率。
- 扰动程度极低——拼写错误的Levenshtein距离≤3,音似攻击的Levenshtein距离≤6,表明攻击具有高度隐蔽性。
- DALL-E 2和Stable Diffusion等模型表现出高度脆弱性,即使在低扰动率下,攻击成功率也超过80%。
- 人工评估得分保持在70分以上,证实修改后的提示语义连贯且自然。
- 该攻击不仅作用于文本编码器,也影响扩散过程本身,表明存在更广泛的架构级脆弱性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。