[论文解读] Image Hijacks: Adversarial Images can Control Generative Models at Runtime
本文提出了图像劫持(image hijacks)——一种通过操纵视觉语言模型(VLM)的生成输出,在推理时控制其行为的对抗性图像。作者提出了一种名为行为匹配(Behaviour Matching)的新方法,生成难以察觉的图像扰动,使 LLaVA(基于 CLIP 和 LLaMA-2 的最先进 VLM)在强制生成任意文本输出、泄露上下文信息或绕过安全防护机制方面成功率超过 90%。
Are foundation models secure against malicious actors? In this work, we focus on the image input to a vision-language model (VLM). We discover image hijacks, adversarial images that control the behaviour of VLMs at inference time, and introduce the general Behaviour Matching algorithm for training image hijacks. From this, we derive the Prompt Matching method, allowing us to train hijacks matching the behaviour of an arbitrary user-defined text prompt (e.g. 'the Eiffel Tower is now located in Rome') using a generic, off-the-shelf dataset unrelated to our choice of prompt. We use Behaviour Matching to craft hijacks for four types of attack, forcing VLMs to generate outputs of the adversary's choice, leak information from their context window, override their safety training, and believe false statements. We study these attacks against LLaVA, a state-of-the-art VLM based on CLIP and LLaMA-2, and find that all attack types achieve a success rate of over 80%. Moreover, our attacks are automated and require only small image perturbations.
研究动机与目标
- 探究不可信的图像输入是否可用于在推理时颠覆视觉语言模型(VLM)的行为。
- 开发一种通用、自动化的生成对抗性图像的方法,以实现对 VLM 输出的细粒度控制。
- 评估在各种扰动约束条件下此类攻击的鲁棒性与现实可行性。
- 证明图像劫持能够绕过安全训练、泄露上下文信息,并以高成功率强制生成任意输出。
- 提高对多模态基础模型在现实部署中安全风险的认识。
提出的方法
- 提出行为匹配(Behaviour Matching),一种训练框架,通过优化图像扰动,使 VLM 的输出与期望行为对齐,而无需依赖输入文本。
- 在图像空间中使用梯度下降训练图像劫持,目标是实现特定输出行为,如生成任意字符串或绕过安全约束。
- 在三种不同的扰动约束条件下应用该方法:ℓ∞-范数有界、静态补丁和动态补丁,以模拟现实世界中的攻击场景。
- 采用白盒威胁模型,攻击者可完全访问 VLM 的架构与参数,以生成鲁棒攻击。
- 将目标行为定义为特定输出字符串(特定字符串攻击)、重复的上下文内容(泄露上下文攻击)以及对有害指令的合规响应(越狱攻击)。
- 利用 VLM 的注意力机制,确保图像输入在输入文本变化或对抗性时仍能主导模型输出。

实验结果
研究问题
- RQ1对抗性图像是否可以用于在推理时控制视觉语言模型的生成输出,而与输入文本无关?
- RQ2在 ℓ∞-范数、静态补丁和动态补丁等不同扰动约束下,图像劫持的有效性如何?
- RQ3图像劫持是否能够绕过模型的安全训练,诱导其生成有害或非预期内容?
- RQ4图像劫持在多大程度上能将模型上下文窗口中的信息泄露到输出中?
- RQ5图像劫持是否具备鲁棒性、自动化与人类难以察觉的特性,使其在现实环境中构成可行威胁?
主要发现
- 图像劫持在 LLaVA LLaMA-2-13B-Chat 模型上,对三种攻击类型(特定字符串、泄露上下文、越狱)的成功率均超过 90%。
- 攻击过程完全自动化,仅需极小的 ℓ∞-范数扰动(例如 16/255),对人类完全不可察觉。
- 行为匹配方法成功生成了对输入文本提示变化具有鲁棒性的图像劫持,确保对模型输出的一致控制。
- 泄露上下文攻击迫使 VLM 将其输入上下文以 API 调用的形式重复输出,揭示了一种新型信息泄露形式。
- 在静态补丁和动态补丁约束下,攻击仍保持有效性,表明其在动态或受限输入环境中的现实可行性。
- 本研究指出,当前的对抗性鲁棒性技术对这类攻击防御能力极低,暗示图像劫持可能在未来多年内持续构成威胁。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。