[论文解读] On the Adversarial Robustness of Multi-Modal Foundation Models
本文表明,像 OpenFlamingo 这类多模态基础模型在视觉输入上极易受到难以察觉的对抗性攻击,其中微小的扰动($varepsilon_{\infty} = \nicefrac{1}{255}$)即可操纵模型输出,生成有针对性的误导性字幕或响应。该研究揭示,此类攻击可被用于传播虚假信息或在不被察觉的情况下操控用户,凸显了在部署模型中加强鲁棒性措施的紧迫需求。
Multi-modal foundation models combining vision and language models such as Flamingo or GPT-4 have recently gained enormous interest. Alignment of foundation models is used to prevent models from providing toxic or harmful output. While malicious users have successfully tried to jailbreak foundation models, an equally important question is if honest users could be harmed by malicious third-party content. In this paper we show that imperceivable attacks on images in order to change the caption output of a multi-modal foundation model can be used by malicious content providers to harm honest users e.g. by guiding them to malicious websites or broadcast fake information. This indicates that countermeasures to adversarial attacks should be used by any deployed multi-modal foundation model.
研究动机与目标
- 调查多模态基础模型在真实部署场景(涉及诚实用户)下对对抗性视觉攻击的易感性。
- 评估针对图像字幕和视觉问答(VQA)任务中使用 OpenFlamingo 模型的有目标和无目标对抗性攻击的有效性。
- 展示此类漏洞在现实世界中的影响,包括可能传播虚假新闻或引导用户访问恶意内容的潜在风险。
- 强调需要为多模态模型引入鲁棒性机制,以防止被恶意第三方利用。
- 提供一个在现实威胁模型下评估多模态模型对抗鲁棒性的框架。
提出的方法
- 本研究采用 Auto-PGD(APGD)攻击算法,设定 $\varepsilon_{\infty} = \nicefrac{1}{255}$,并进行 5000 次迭代,以在图像输入上生成有目标和无目标的对抗性扰动。
- 攻击在零样本设置下的 OpenFlamingo 模型上针对图像字幕和视觉问答(VQA)任务进行评估。
- 性能通过标准指标进行衡量:字幕任务使用 CIDEr 分数,有目标攻击使用攻击成功率。
- 研究人员通过逐步将最小幅值分量置零,分析扰动的鲁棒性,以评估最小有效扰动。
- 威胁模型假设恶意第三方在图像被模型处理前对其输入进行篡改,而非用户直接进行越狱攻击。
- 实验在 COCO 数据集上进行,使用如 'Please reset your password' 等有目标字幕,以测试操控能力。

实验结果
研究问题
- RQ1难以察觉的对抗性扰动能否操纵多模态基础模型(如 OpenFlamingo)的输出?
- RQ2通过细微的图像修改,有目标攻击在多大程度上能控制模型的文本输出?
- RQ3当仅保留部分扰动幅值时,对抗性扰动的效率如何?
- RQ4此类漏洞在新闻生成或用户引导等应用中的现实后果是什么?
- RQ5在不同威胁模型下,尤其在极小的 $\varepsilon_{\infty}$ 值下,攻击的鲁棒性如何变化?
主要发现
- 在 $\varepsilon_{\infty} = \nicefrac{1}{255}$ 条件下,对抗性攻击能以高成功率成功操纵 OpenFlamingo 模型的输出,生成如 'Please reset your password' 等有目标字幕。
- 即使仅保留 60% 的扰动幅值,攻击仍保持高成功率,表明极小的扰动仍可极为有效。
- 在无目标攻击下,CIDEr 分数显著下降,证实模型在对抗性输入下性能严重退化。
- 这些扰动对人类而言难以察觉,使其成为隐蔽操纵模型输出而不会被用户发现的理想手段。
- 研究证实,恶意第三方可利用这些漏洞通过模型生成的文本注入虚假信息,或引导用户访问有害内容。
- 结果表明,当前多模态基础模型在对抗性输入下仍缺乏足够的鲁棒性,即使扰动半径极小亦然。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。