[论文解读] FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models
FuzzLLM 是一种新颖的通用模糊测试框架,通过使用模板、约束和禁止问题自动生成多样化、结构多变的提示,主动发现大型语言模型(LLMs)中的越狱漏洞。该框架表现出高效率——即使在小规模测试集下,也能成功识别 GPT-3.5-turbo 和 GPT-4 等最先进模型中的越狱漏洞,且在组合攻击场景中优于单一组件攻击。
Jailbreak vulnerabilities in Large Language Models (LLMs), which exploit meticulously crafted prompts to elicit content that violates service guidelines, have captured the attention of research communities. While model owners can defend against individual jailbreak prompts through safety training strategies, this relatively passive approach struggles to handle the broader category of similar jailbreaks. To tackle this issue, we introduce FuzzLLM, an automated fuzzing framework designed to proactively test and discover jailbreak vulnerabilities in LLMs. We utilize templates to capture the structural integrity of a prompt and isolate key features of a jailbreak class as constraints. By integrating different base classes into powerful combo attacks and varying the elements of constraints and prohibited questions, FuzzLLM enables efficient testing with reduced manual effort. Extensive experiments demonstrate FuzzLLM's effectiveness and comprehensiveness in vulnerability discovery across various LLMs.
研究动机与目标
- 为应对当前 LLM 安全防御机制的被动性(即在公开披露后才修补个别越狱漏洞),通过实现主动漏洞发现来加以改进。
- 克服因缺乏多样化、带标签的越狱数据而限制 LLM 有效安全微调的问题。
- 开发一种通用的、自动化的框架,可在无需访问模型内部信息的情况下,测试任意 LLM 的越狱漏洞。
- 通过将攻击分解为可重用的组件(模板、约束和问题集),系统性地生成多样化且鲁棒的越狱提示。
- 评估组合攻击(结合多种越狱类型,如角色扮演、输出约束、权限提升)在扩大漏洞覆盖范围方面的有效性。
提出的方法
- FuzzLLM 使用黑盒、输入输出(IO)驱动的模糊测试,无需访问模型内部信息即可测试 LLM,通过基于模板的组合生成越狱提示。
- 它将越狱攻击分解为三个核心组件:结构化模板、约束集(成功越狱的关键特征)以及禁止问题集(违反政策的查询)。
- 通过混合约束和问题,将三种基础越狱类型(角色扮演(RP)、输出约束(OC)、权限提升(PE))组合成强大的组合攻击。
- 系统使用标签模型(如 Vicuna-13B)自动将输出分类为“坏”(越狱成功)或“好”(安全),并通过误差率衡量其可靠性。
- 系统使用超参数:每类测试集大小 Tes=300(总计 2100 个),温度=0.7,最大输出 token 数 tk=256,结果基于三个随机种子的平均值计算。
- 消融研究评估了测试集大小和输出 token 限制的影响,发现不同大小下性能变化极小,且在 tk=64 时出现反直觉的成功率峰值,原因在于不完整输出被误判为‘坏’。
实验结果
研究问题
- RQ1是否存在一种通用的、自动化的模糊测试框架,可在无需访问模型内部信息的情况下,有效发现多种 LLM 中的越狱漏洞?
- RQ2将多种基础越狱类型(RP、OC、PE)组合为组合攻击,相比单一组件攻击,是否能显著提升漏洞发现能力?
- RQ3测试集大小和输出 token 限制对使用自动化标签模型进行越狱检测的可靠性与性能有何影响?
- RQ4FuzzLLM 在发现最先进的、防护严密的 LLM(如 GPT-3.5-turbo 和 GPT-4)中的越狱漏洞方面效果如何?
- RQ5轻量级、开源的 LLM 是否可作为可靠标签模型,以可接受的误差率准确分类越狱成功与否?
主要发现
- 尽管 GPT-3.5-turbo 和 GPT-4 具有先进的安全防御机制,FuzzLLM 仍成功发现了其越狱漏洞,证明了其主动发现能力。
- 组合攻击(结合 RP、OC、PE 三种基础类型)在 GPT-4 上实现了 19.61% 的越狱成功率,显著高于单一组件攻击(11.92%),表明其具有更优的覆盖范围和攻击强度。
- 标签模型 Vicuna-13B 在所有测试模型中误差率最低(4.08%),优于 Bloom-7B(14.35%)和 LLAMA-7B(11.57%),验证了其在自动化标注中的可靠性。
- 消融研究显示,不同测试集大小(Tes=50 至 500)下性能变化极小,表明即使在小规模测试下,结果也具有稳定性和可泛化性。
- 当 tk=64 时,成功率出现峰值(82.26%),原因是仅包含恶意问题的不完整输出被误判为‘坏’,揭示了输出长度对检测敏感性的关键影响。
- 在组合攻击模式下,FuzzLLM 在 GPT-3.5-turbo(23.57% vs. 23.12%)和 GPT-4(19.61% vs. 11.92%)上的表现均优于单一组件攻击,证实了组合攻击模式的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。