Skip to main content
QUICK REVIEW

[论文解读] Attacking Visual Language Grounding with Adversarial Examples: A Case Study on Neural Image Captioning

Hongge Chen, Huan Zhang|arXiv (Cornell University)|Dec 6, 2017
Multimodal Machine Learning Applications参考文献 49被引用 20
一句话总结

本文提出 Show-and-Fool,一种基于优化的新方法,通过针对特定字幕或关键词生成对抗性样本,用于神经图像字幕模型。该方法在生成难以察觉的扰动方面表现出极高成功率,可误导当前最先进的字幕模型,揭示了视觉-语言对齐系统中显著的鲁棒性漏洞。

ABSTRACT

Visual language grounding is widely studied in modern neural image captioning systems, which typically adopts an encoder-decoder framework consisting of two principal components: a convolutional neural network (CNN) for image feature extraction and a recurrent neural network (RNN) for language caption generation. To study the robustness of language grounding to adversarial perturbations in machine vision and perception, we propose Show-and-Fool, a novel algorithm for crafting adversarial examples in neural image captioning. The proposed algorithm provides two evaluation approaches, which check whether neural image captioning systems can be mislead to output some randomly chosen captions or keywords. Our extensive experiments show that our algorithm can successfully craft visually-similar adversarial examples with randomly targeted captions or keywords, and the adversarial examples can be made highly transferable to other image captioning systems. Consequently, our approach leads to new robustness implications of neural image captioning and novel insights in visual language grounding.

研究动机与目标

  • 研究神经图像字幕模型对对抗性扰动的鲁棒性,此类扰动相较于图像分类更为复杂,因其输出为开放式、自然语言形式。
  • 解决在图像字幕中生成目标对抗性样本的挑战,其输出空间庞大且语义细腻,不同于离散的类别标签。
  • 开发一种通用的基于优化的框架,可为视觉-语言对齐中使用的 CNN+RNN 架构生成对抗性样本。
  • 评估对抗性样本在不同图像字幕模型间的可迁移性,揭示当前架构中的共性漏洞。

提出的方法

  • 提出 Show-and-Fool,一种基于优化的算法,将对抗性样本生成建模为带复合损失函数的约束优化问题。
  • 使用图像失真(如 ℓ∞ 范数)与任务特定损失函数的线性组合,以平衡视觉不可察觉性与攻击有效性。
  • 采用两种不同的攻击模式:目标字幕攻击(强制生成特定字幕)与目标关键词攻击(确保特定关键词出现在字幕中)。
  • 在关键词攻击中,损失函数仅要求生成字幕中包含指定关键词,允许模型围绕这些关键词自然组织语句。
  • 利用基于梯度的优化方法,生成小幅度、视觉上不可察觉的扰动,以最大化目标字幕或关键词出现的可能性。
  • 在 MSCOCO 数据集上通过 Show-and-Tell、Show-Attend-and-Tell 和 NeuralTalk 等模型验证该方法,证明其在不同模型间的可迁移性。

实验结果

研究问题

  • RQ1能否在神经图像字幕中有效生成对抗性样本,使模型生成特定的目标字幕?
  • RQ2能否生成对抗性样本,强制在字幕中包含特定关键词,即使模型可自由组织句子结构?
  • RQ3所生成的对抗性样本在具有相似 CNN+RNN 架构的不同图像字幕模型之间是否具有可迁移性?
  • RQ4由于输出空间无界且语义丰富,图像字幕攻击是否本质上比图像分类攻击更困难?
  • RQ5对抗性扰动在多大程度上暴露了人类感知与机器理解之间在视觉-语言对齐上的不一致性?

主要发现

  • Show-and-Fool 在多个当前最先进的图像字幕模型上实现了高攻击成功率——目标字幕攻击成功率超过 90%,目标关键词攻击成功率超过 85%。
  • Show-and-Fool 生成的对抗性样本在视觉上难以察觉,ℓ∞ 扰动低至 0.01,且与原始图像保持高度语义相似性。
  • 对抗性样本表现出强大的可迁移性,即使在不同数据划分上训练的其他图像字幕模型(如 Show-Attend-and-Tell、NeuralTalk)中也成功实现欺骗。
  • 与标准图像分类攻击(I-FGSM 和 C&W)相比,尽管使用了更大的扰动,但在字幕模型上的攻击成功率仅为 34.5% 和 22.4%,证实了字幕攻击的内在难度。
  • 结果揭示了视觉-语言对齐中的根本性不一致:模型可被误导生成语义错误的字幕,同时保持视觉相似性,暴露出多模态人工智能系统中的关键脆弱性。
  • 本研究表明,当前图像字幕模型对细微、难以察觉的扰动缺乏鲁棒性,提示需通过对抗性训练或架构重构来提升其鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。