Skip to main content
QUICK REVIEW

[论文解读] AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models

Sicheng Zhu, Ruiyi Zhang|arXiv (Cornell University)|Oct 23, 2023
Topic Modeling被引用 5
一句话总结

AutoDAN 提出了一种新颖的、可解释的、基于梯度的大型语言模型对抗性攻击方法,通过从左到右顺序优化标记(tokens),生成人类可读的、高成功率的越狱提示。与以往产生无意义文本或依赖人工设计的方法不同,AutoDAN 在仅使用有限训练数据的情况下,仍能实现高可读性与强迁移能力,同时支持自动提取系统提示。

ABSTRACT

Safety alignment of Large Language Models (LLMs) can be compromised with manual jailbreak attacks and (automatic) adversarial attacks. Recent studies suggest that defending against these attacks is possible: adversarial attacks generate unlimited but unreadable gibberish prompts, detectable by perplexity-based filters; manual jailbreak attacks craft readable prompts, but their limited number due to the necessity of human creativity allows for easy blocking. In this paper, we show that these solutions may be too optimistic. We introduce AutoDAN, an interpretable, gradient-based adversarial attack that merges the strengths of both attack types. Guided by the dual goals of jailbreak and readability, AutoDAN optimizes and generates tokens one by one from left to right, resulting in readable prompts that bypass perplexity filters while maintaining high attack success rates. Notably, these prompts, generated from scratch using gradients, are interpretable and diverse, with emerging strategies commonly seen in manual jailbreak attacks. They also generalize to unforeseen harmful behaviors and transfer to black-box LLMs better than their unreadable counterparts when using limited training data or a single proxy model. Furthermore, we show the versatility of AutoDAN by automatically leaking system prompts using a customized objective. Our work offers a new way to red-team LLMs and understand jailbreak mechanisms via interpretability.

研究动机与目标

  • 解决现有对抗性攻击生成不可读、易被困惑度过滤检测的提示的问题。
  • 弥合人工越狱(可读但稀少)与自动攻击(不可读但可扩展)之间的差距。
  • 开发一种基于梯度的方法,生成可解释、可迁移且有效的越狱提示,无需事先的任务特定知识。
  • 通过定制化的优化目标,实现自动系统提示泄露。
  • 通过生成多样化、可解释的攻击策略,提升红队测试能力,使其与人工设计的越狱策略相匹配。

提出的方法

  • AutoDAN 从左到右逐个标记生成攻击提示,模仿自回归语言生成过程,以降低优化复杂度。
  • 每个标记采用两步优化过程:初步步骤用于探索合理候选,精细调整步骤用于平衡越狱效果与可读性。
  • 通过结合越狱成功率与困惑度(可读性)的加权目标函数,指导基于梯度的优化,并根据不同的标记熵自适应调整。
  • 该方法仅使用一个白盒代理模型生成提示,使其能良好泛化至 GPT-3.5 和 GPT-4 等黑盒 LLM。
  • 针对系统提示泄露,应用定制化的目标函数,直接优化以提取隐藏的系统指令。
  • 该方法完全自动化,无需已知的越狱模板或人工设计的策略。

实验结果

研究问题

  • RQ1基于梯度的优化能否生成可解释、可读的对抗性提示,从而绕过基于困惑度的过滤机制?
  • RQ2自动攻击方法能否同时实现高攻击成功率与高可读性,融合人工与自动攻击的优势?
  • RQ3与传统对抗性攻击相比,AutoDAN 生成的提示在黑盒 LLM 上的迁移能力如何?
  • RQ4AutoDAN 能否自动生成泄露隐藏系统指令的提示?
  • RQ5生成的提示是否展现出与人工越狱中常见的多样化、可解释的策略(如角色扮演、指令操纵)相似的模式?

主要发现

  • AutoDAN 生成的提示在保持低困惑度的同时,实现了高攻击成功率(在 Vicuna 7B 上超过 90%),并聚集在成功率-困惑度权衡空间的左上角区域。
  • 与 GCG-reg(困惑度正则化)相比,AutoDAN 在可读性与攻击成功率两方面均表现更优,尤其在低正则化权重下优势更明显。
  • 即使仅在单一代理模型上训练,AutoDAN 生成的提示在 GPT-3.5 和 GPT-4 等黑盒模型上的泛化能力也优于 GCG 生成的不可读提示。
  • AutoDAN 生成的提示展现出多样化、可解释的策略,如角色扮演和指令操纵,这些策略在人工越狱中常见。
  • 通过定制化目标函数,AutoDAN 有效实现了系统提示泄露,证明其能力不仅限于标准越狱任务。
  • Semi-AutoDAN(结合人工前缀/后缀)在不牺牲攻击效果的前提下,进一步提升了提示质量与风格控制能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。