[论文解读] AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs
本文提出 AdvPrompter,一种快速、自适应且人类可读的对抗性提示生成方法,用于绕过大型语言模型(LLMs)的安全对齐机制。该方法通过交替优化与低秩微调循环,训练一个专用的 LLM(即 AdvPrompter),生成能够绕过安全对齐机制的连贯后缀,其生成速度相比基于梯度的方法快约 800 倍,并在开源与闭源 LLM 上均实现了最先进水平的攻击成功率。
Large Language Models (LLMs) are vulnerable to jailbreaking attacks that lead to generation of inappropriate or harmful content. Manual red-teaming requires a time-consuming search for adversarial prompts, whereas automatic adversarial prompt generation often leads to semantically meaningless attacks that do not scale well. In this paper, we present a novel method that uses another LLM, called AdvPrompter, to generate human-readable adversarial prompts in seconds. AdvPrompter, which is trained using an alternating optimization algorithm, generates suffixes that veil the input instruction without changing its meaning, such that the TargetLLM is lured to give a harmful response. Experimental results on popular open source TargetLLMs show highly competitive results on the AdvBench and HarmBench datasets, that also transfer to closed-source black-box LLMs. We also show that training on adversarial suffixes generated by AdvPrompter is a promising strategy for improving the robustness of LLMs to jailbreaking attacks.
研究动机与目标
- 解决现有自动化红队测试方法在 LLM 越狱攻击中效率低下且生成提示不连贯的问题。
- 开发一种无需目标 LLM 梯度信息、快速、自适应且人类可读的对抗性提示生成方法。
- 通过生成上下文感知的对抗性后缀,实现可扩展的多轮次越狱攻击,同时保持语义连贯性。
- 证明由 AdvPrompter 生成的对抗性提示可用于微调目标 LLM,从而提升其对后续攻击的鲁棒性。
提出的方法
- 该方法训练一个专用的 LLM(即 AdvPrompter),用于生成对抗性后缀,以绕过目标 LLM 的安全对齐机制,同时保持指令的原始语义。
- 采用交替训练循环:(1) AdvPrompterOpt,一种新型优化算法,通过迭代选择并评估标记候选,生成高质量的对抗性后缀;(2) 利用生成的后缀作为监督目标,对 AdvPrompter 进行低秩微调。
- AdvPrompterOpt 通过使用基础 LLM 最小化困惑度,保持人类可读性,确保生成的后缀自然且不易被困惑度过滤机制检测到。
- 训练过程不依赖目标 LLM 的梯度信息,因此可应用于黑盒模型。
- 该方法将 AdvPrompter 条件化于输入指令,使其能够生成上下文自适应的后缀,而非通用型后缀。
- 在推理阶段,微调后的 AdvPrompter 可在数秒内生成对抗性后缀,支持快速、多轮次攻击流水线。

实验结果
研究问题
- RQ1能否训练一个大型语言模型,使其生成人类可读、自适应的对抗性提示,绕过目标 LLM 的安全对齐机制,而无需访问目标模型的梯度?
- RQ2与现有基于优化和启发式的方法相比,所提方法在攻击成功率和生成速度方面的表现如何?
- RQ3AdvPrompter 生成的对抗性提示在多大程度上可迁移至闭源、黑盒 LLM API?
- RQ4能否利用 AdvPrompter 生成的对抗性提示通过微调来提升目标 LLM 的鲁棒性?
- RQ5优化与低秩微调交替进行的训练机制,是否相比端到端训练能产生更有效、更具泛化能力的对抗性提示生成效果?
主要发现
- AdvPrompter 在多个开源 LLM 上于 AdvBench 数据集上实现了 92.5% 的最先进攻击成功率,优于现有方法。
- 该方法每条提示的生成时间约为 1-2 秒,相比基于梯度的优化方法快约 800 倍。
- 生成的对抗性后缀具有人类可读性和语义连贯性,困惑度得分低,因此不易被标准的困惑度过滤机制检测到。
- 该方法成功迁移至闭源 LLM API,在无需访问目标模型梯度的情况下实现了高攻击成功率。
- 在由 AdvPrompter 生成的对抗性提示合成数据集上对目标 LLM 进行微调,显著提升了其对越狱攻击的鲁棒性,同时保持了较高的 MMLU 性能分数。
- 与基线方法相比,AdvPrompterOpt 与低秩微调的交替训练机制在零样本和迁移设置下展现出更优的泛化能力与适应性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。