[论文解读] Fooling Vision and Language Models Despite Localization and Attention Mechanism
本论文表明,尽管视觉-语言模型——包括带有注意力机制、定位和模块化架构的密集字幕生成与视觉问答(VQA)系统——具有复杂的内部结构,但仍对对抗性攻击高度脆弱。通过一种新颖的白盒攻击方法,作者在欺骗最先进模型(如MCB和N2NMN)方面取得了超过90%的成功率,揭示了注意力机制、边界框定位和组合式网络在非物理场景下并不能有效防御定向对抗性样本。
Adversarial attacks are known to succeed on classifiers, but it has been an open question whether more complex vision systems are vulnerable. In this paper, we study adversarial examples for vision and language models, which incorporate natural language understanding and complex structures such as attention, localization, and modular architectures. In particular, we investigate attacks on a dense captioning model and on two visual question answering (VQA) models. Our evaluation shows that we can generate adversarial examples with a high success rate (i.e., > 90%) for these models. Our work sheds new light on understanding adversarial attacks on vision systems which have a language component and shows that attention, bounding box localization, and compositional internal structures are vulnerable to adversarial attacks. These observations will inform future work towards building effective defenses.
研究动机与目标
- 探究具备注意力机制、定位和模块化架构的先进视觉-语言模型是否对对抗性攻击具有鲁棒性。
- 在白盒条件下评估对抗性攻击对密集字幕生成和VQA模型的有效性。
- 分析语言先验和模型架构组合性是否影响对抗性鲁棒性。
- 开发一种新型攻击方法,其在VQA模型上的表现优于现有最先进方法。
- 理解答案频率和语义兼容性在对抗性攻击成功中的作用。
提出的方法
- 作者设计了一种针对视觉-语言模型的定向白盒对抗性攻击框架,利用基于梯度的优化方法扰动输入图像。
- 该攻击通过优化目标标签的高置信度,同时保持图像扰动的不可察觉性,针对VQA模型中的特定答案进行攻击。
- 引入一种新型损失函数,以平衡对抗性攻击的成功率、图像扰动程度以及与问题的语义一致性。
- 该方法通过使用标准和无意义的问答对,在MCB和N2NMN等多种模型上评估了攻击成功率。
- 作者分析了答案频率与对抗性概率之间的相关性,以评估模型的可预测性和鲁棒性。
- 实验包括使用无意义答案目标的消融研究,以隔离语言先验对攻击成功率的影响。
实验结果
研究问题
- RQ1对抗性样本能否成功欺骗使用注意力机制和区域定位的视觉-语言模型?
- RQ2与标准注意力模型相比,神经模块网络等模块化架构是否能提供更强的对抗性攻击鲁棒性?
- RQ3语言先验——特别是问题与答案之间的语义兼容性——如何影响对抗性攻击的成功率?
- RQ4答案频率在多大程度上与对抗性攻击成功率相关?
- RQ5新型攻击方法能否在VQA模型上超越现有最先进攻击方法?
主要发现
- 所提出的攻击方法在MCB和N2NMN VQA模型上的成功率均超过90%,证明其在复杂内部结构下仍具高度有效性。
- 具有更强语言先验的模型(如N2NMN)表现出略高的鲁棒性,在使用无意义答案目标时仅达到4.6%的攻击成功率,而MCB为7.8%。
- 答案频率与对抗性概率之间存在明显的正相关关系,表明高频预测答案更容易被目标攻击。
- N2NMN模型产生的非零频率答案数量少于MCB,表明其预测空间更受约束且语义更一致。
- 当目标答案与问题在语义上不兼容时,对抗性攻击失败率显著升高,证实了语言先验在防御中的作用。
- 尽管使用了注意力图、区域提议和模块化网络组合,这些组件在白盒设置下仍无法防止成功的对抗性攻击。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。