[论文解读] Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
本文通过在推理和训练阶段均显式优先考虑安全性而非帮助性,提出了一种防御大型语言模型(LLMs)免受越狱攻击的方法。在推理阶段,该方法将ChatGPT的攻击成功率(ASR)从66.4%降低至2.0%,将Vicuna-33B的ASR从68.2%降低至19.4%;当使用目标优先化进行训练时,Llama2-13B的ASR仅为6.6%,即使训练中未使用越狱数据,也显著提升了安全性。
While significant attention has been dedicated to exploiting weaknesses in LLMs through jailbreaking attacks, there remains a paucity of effort in defending against these attacks. We point out a pivotal factor contributing to the success of jailbreaks: the intrinsic conflict between the goals of being helpful and ensuring safety. Accordingly, we propose to integrate goal prioritization at both training and inference stages to counteract. Implementing goal prioritization during inference substantially diminishes the Attack Success Rate (ASR) of jailbreaking from 66.4% to 3.6% for ChatGPT. And integrating goal prioritization into model training reduces the ASR from 71.0% to 6.6% for Llama2-13B. Remarkably, even in scenarios where no jailbreaking samples are included during training, our approach slashes the ASR by half. Additionally, our findings reveal that while stronger LLMs face greater safety risks, they also possess a greater capacity to be steered towards defending against such attacks, both because of their stronger ability in instruction following. Our work thus contributes to the comprehension of jailbreaking attacks and defenses, and sheds light on the relationship between LLMs' capability and safety. Our code is available at \url{https://github.com/thu-coai/JailbreakDefense_GoalPriority}.
研究动机与目标
- 识别越狱攻击成功的核心原因,即LLMs中帮助性与安全性目标之间未解决的冲突。
- 解决尽管对齐技术(如SFT和RLHF)取得进展,但对越狱攻击仍缺乏有效防御的问题。
- 开发一种在推理和训练阶段均显式优先考虑安全性的防御机制。
- 评估该防御方法在分布外(OOD)越狱攻击中的泛化能力,特别是当训练中未使用越狱提示时。
- 探索LLM能力与安全性之间的关系,特别是更强大的模型是否更易受攻击或更易被引导至安全方向。
提出的方法
- 设计了一种即插即用的提示策略,在推理阶段通过将用户查询与强调安全性优先于帮助性的目标指令配对,实现目标优先化的注入。
- 该方法采用两阶段提示框架,先引导模型识别目标优先级(安全性 > 帮助性),再生成响应。
- 在训练阶段,通过在良性与有害指令的混合数据上微调模型,并施加显式监督,使模型学习到安全性优先的原则。
- 训练数据中包含受控比例的有害查询(1%、3%、5%),以评估数据效率及数据多样性对防御性能的影响。
- 通过在分布内和分布外的越狱提示上评估攻击成功率(ASR)和防御成功率(DSR),对防御机制进行评估。
- 该方法应用于多种LLM,包括ChatGPT、Vicuna、Llama2和Alpaca,涵盖基于API和开源模型。
实验结果
研究问题
- RQ1为何标准对齐方法(如SFT和RLHF)在提升安全性的同时,仍无法有效防御越狱攻击?
- RQ2显式的目标优先化(将安全性设为主要目标)是否能显著降低越狱攻击的成功率?
- RQ3仅在推理阶段应用目标优先化而无需模型微调时,其有效性如何?
- RQ4目标优先化在应对未见过的、分布外的越狱攻击时,其泛化能力有多强?
- RQ5模型能力是否与越狱攻击的脆弱性相关?更强的模型是否能更有效地被引导至安全性方向?
主要发现
- 当在推理阶段应用目标优先化时,ChatGPT的攻击成功率(ASR)从66.4%降至2.0%,表明越狱成功概率降低了97%。
- 对于Vicuna-33B,相同推理阶段防御使ASR从68.2%降至19.4%,表明该方法在不同模型上均表现出强鲁棒性。
- 当使用目标优先化进行训练时,Llama2-13B的ASR仅为6.6%,而标准SFT下的ASR为71.0%,表明脆弱性降低了90.7%。
- 即使训练数据中未包含任何越狱提示,该方法仍可将ASR从71.0%降至34.0%,表明仅通过简单有害指令即可学习目标优先化。
- 该防御方法在分布外(OOD)越狱攻击中泛化能力出色:在无越狱提示的训练下,相比对齐SFT,DSR提升22.8%;相比原始SFT,DSR提升30%。
- 该方法具有更优的数据效率:仅使用1%有害查询并结合目标优先化,其ASR低于使用5%有害查询的对齐SFT,表明其数据利用效率更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。