[论文解读] How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs
本文提出了一套全面的视觉-语言大模型(VLLMs)安全评估基准,通过两个新型VQA数据集——OODCV-VQA和Sketchy-VQA,以及针对视觉和语言组件的针对性攻击,评估了模型在分布外(OOD)泛化能力和对抗鲁棒性方面的表现。关键发现表明,VLLMs在解释分布外视觉输入方面表现出色,但在面对分布外文本扰动时表现不佳,对视觉编码器攻击敏感,并且由于视觉-语言预训练,其安全协议被削弱。
This work focuses on the potential of Vision LLMs (VLLMs) in visual reasoning. Different from prior studies, we shift our focus from evaluating standard performance to introducing a comprehensive safety evaluation suite, covering both out-of-distribution (OOD) generalization and adversarial robustness. For the OOD evaluation, we present two novel VQA datasets, each with one variant, designed to test model performance under challenging conditions. In exploring adversarial robustness, we propose a straightforward attack strategy for misleading VLLMs to produce visual-unrelated responses. Moreover, we assess the efficacy of two jailbreaking strategies, targeting either the vision or language component of VLLMs. Our evaluation of 21 diverse models, ranging from open-source VLLMs to GPT-4V, yields interesting observations: 1) Current VLLMs struggle with OOD texts but not images, unless the visual information is limited; and 2) These VLLMs can be easily misled by deceiving vision encoders only, and their vision-language training often compromise safety protocols. We release this safety evaluation suite at https://github.com/UCSC-VLAA/vllm-safety-benchmark.
研究动机与目标
- 为解决视觉大语言模型中系统性安全评估的缺失,特别是针对分布外泛化和对抗鲁棒性的问题。
- 开发一个全面的基准,用于测试VLLM在多种故障模式下的安全性,包括视觉和文本扰动。
- 探究视觉-语言预训练如何损害对齐大语言模型的安全协议。
- 评估针对VLLM视觉或语言模态的越狱攻击的有效性。
- 识别影响VLLM安全性的架构与训练设计因素,特别是开源与闭源模型之间的差异。
提出的方法
- 提出了两个新的分布外VQA数据集——OODCV-VQA和Sketchy-VQA,通过使用罕见视觉概念和反事实描述来测试分布外泛化能力。
- 设计了一种简单但有效的攻击策略,通过将CLIP视觉编码器与无关的文本对象对齐,以误导VLLM的输出。
- 评估了两种越狱策略:针对视觉和语言输入的白盒攻击与迁移攻击,以评估毒性指令诱导的效果。
- 在21个模型上进行了广泛评估,包括开源VLLM和GPT-4V,覆盖多种分布外场景和攻击类型。
- 通过分析不同大语言模型架构、视觉编码器和微调配置下的模型表现,分离出与安全性相关的设计因素。
- 发布了包含数据集和代码的基准套件,以支持可复现性与未来研究。
实验结果
研究问题
- RQ1当语言输入被反事实地扰动时,VLLMs在面对分布外视觉输入和文本输入时的表现如何,特别是语言输入为反事实描述时?
- RQ2针对视觉编码器的简单攻击(如基于CLIP ViT的攻击)是否能有效误导VLLMs,使其生成不相关或错误的回答?
- RQ3仅通过操纵视觉输入而保持语言提示不变,越狱攻击在多大程度上是有效的?
- RQ4为何视觉-语言预训练过程会削弱对齐大语言模型的安全协议?这又如何影响模型行为?
- RQ5哪些架构与训练选择(如模型规模、视觉编码器类型或数据多样性)对VLLM安全性影响最大?
主要发现
- VLLMs在处理分布外视觉输入(如异常纹理、姿势、形状)方面表现出色,但在语言输入被反事实扰动时显著受挫。
- GPT-4V和开源VLLM等模型在视觉编码器攻击上的攻击成功率(ASR)比其他模型低33.5%,表明当安全机制激活时具备更强的抵抗力。
- 基于草图的图像构成重大挑战:即使是对草图进行简单的“是/否”问题,也导致高错误率,GPT-4V在基础识别任务上也出现失败。
- 基于CLIP ViT的简单攻击在误导VLLM方面的成功率与集成攻击相当甚至更优,表明仅通过操纵视觉编码器即可实现高度有效的影响。
- 视觉-语言预训练始终会削弱大语言模型的安全协议,使用标准数据集训练的模型在遭遇对抗输入时无法拒绝有毒或无关的回答。
- InstructBLIP尽管与MiniGPT4架构相似,但表现更优,这归因于其使用了13个多样化的视觉-语言数据集,凸显了数据多样性与质量在安全性和鲁棒性中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。