Skip to main content
QUICK REVIEW

[论文解读] Misusing Tools in Large Language Models With Visual Adversarial Examples

Xiaohan Fu, Zihan Wang|arXiv (Cornell University)|Oct 4, 2023
Adversarial Robustness in Machine Learning被引用 6
一句话总结

本文提出一种白盒、基于图像的对抗性攻击,通过使用人眼难以察觉的视觉扰动,操纵多模态大语言模型(LLMs)触发恶意工具调用——例如删除邮件或预订酒店。该攻击在多种提示下实现了接近完美的成功率(约98%),同时保持了较高的图像相似度(SSIM ≈ 0.9)并维持自然的对话流程,展现出极强的隐蔽性与泛化能力。

ABSTRACT

Large Language Models (LLMs) are being enhanced with the ability to use tools and to process multiple modalities. These new capabilities bring new benefits and also new security risks. In this work, we show that an attacker can use visual adversarial examples to cause attacker-desired tool usage. For example, the attacker could cause a victim LLM to delete calendar events, leak private conversations and book hotels. Different from prior work, our attacks can affect the confidentiality and integrity of user resources connected to the LLM while being stealthy and generalizable to multiple input prompts. We construct these attacks using gradient-based adversarial training and characterize performance along multiple dimensions. We find that our adversarial images can manipulate the LLM to invoke tools following real-world syntax almost always (~98%) while maintaining high similarity to clean images (~0.9 SSIM). Furthermore, using human scoring and automated metrics, we find that the attacks do not noticeably affect the conversation (and its semantics) between the user and the LLM.

研究动机与目标

  • 为解决增强工具能力和视觉能力的多模态大语言模型中存在的安全缺口,这些模型易受损害用户资源完整性与机密性的攻击。
  • 开发一种兼具隐蔽性(使用人眼难以察觉的图像扰动)与跨多样化用户提示的泛化能力的攻击,区别于以往局限于特定输入的攻击方法。
  • 证明对抗性图像可诱导复杂、非自然语言格式的工具调用(如API调用),而不会破坏用户与大语言模型对话的自然流程。
  • 揭示当前大语言模型对齐定义中的关键错位漏洞:其聚焦于广泛的人类价值观,却忽视了用户与任务特定的安全风险。
  • 倡导在开放权重的多模态大语言模型广泛部署前,采取主动安全措施,例如对工具访问实施严格的授权控制。

提出的方法

  • 该攻击使用基于梯度的对抗性训练,生成对人类而言难以察觉的视觉扰动,使大语言模型生成特定、由攻击者控制的工具调用语法。
  • 该方法在白盒设置下训练,需访问模型参数,以优化在各种输入提示下触发期望工具调用的成功率。
  • 引入响应效用损失项,以保持大语言模型对话输出的自然性与连贯性,确保攻击保持隐蔽。
  • 该攻击在域内与域外提示上均进行了评估,证明其超越特定图像上下文的泛化能力。
  • 通过自动化指标(SSIM、损失)与人工评估相结合,验证了图像相似度与对话质量。
  • 该攻击应用于多种工具类型,包括邮件删除、发送邮件与酒店预订,涵盖不同程度的语法复杂性。

实验结果

研究问题

  • RQ1是否可利用视觉对抗样本操纵多模态大语言模型,以高成功率与高隐蔽性执行攻击者指定的复杂工具调用?
  • RQ2该攻击在不同用户提示(包括与图像内容无关的提示)上的泛化程度如何?
  • RQ3尽管诱导了恶意工具使用,该攻击在多大程度上保持了大语言模型对话响应的自然性与实用性?
  • RQ4攻击成功率与图像扰动隐蔽性之间的权衡如何?是否可针对不同威胁模型进行调节?
  • RQ5该攻击在域外样本上的表现如何?是否能有效迁移至未见过的输入?

主要发现

  • 该攻击在与图像相关的提示上实现了约98%的成功率,而在无关提示上的成功率显著下降至约60–70%,表明其具备强大的泛化能力。
  • 对抗样本与原始图像之间的平均SSIM约为0.9,证实了高度的视觉相似性与强隐蔽性。
  • 响应效用损失指标显示,与干净模型生成相比,偏好度仅下降约10%,表明对话质量下降极小。
  • 该攻击在域外测试集上也表现出有效的泛化能力,不同工具类型与未见提示下的成功率保持较高水平(如66–98%)。
  • 即使目标工具调用语法复杂或非自然(如'send_email_hard'变体,需精确的API级格式),该攻击仍保持有效。
  • 人工评估确认,尽管大语言模型执行了恶意操作,对话仍保持自然,与良性交互难以区分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。