Skip to main content
QUICK REVIEW

[论文解读] Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM

Bochuan Cao, Yuanpu Cao|arXiv (Cornell University)|Sep 18, 2023
Natural Language Processing Techniques被引用 6
一句话总结

本文提出鲁棒对齐大语言模型(RA-LLM),一种防御机制,通过在测试输入时应用带有随机标记丢弃的蒙特卡洛采样,提升现有对齐大语言模型对对齐破坏攻击的鲁棒性。该方法在无需微调的情况下,将攻击成功率从接近100%降低至10%以下,利用模型固有的对齐能力,同时增强对对抗性提示的抵抗力。

ABSTRACT

Recently, Large Language Models (LLMs) have made significant advancements and are now widely used across various domains. Unfortunately, there has been a rising concern that LLMs can be misused to generate harmful or malicious content. Though a line of research has focused on aligning LLMs with human values and preventing them from producing inappropriate content, such alignments are usually vulnerable and can be bypassed by alignment-breaking attacks via adversarially optimized or handcrafted jailbreaking prompts. In this work, we introduce a Robustly Aligned LLM (RA-LLM) to defend against potential alignment-breaking attacks. RA-LLM can be directly constructed upon an existing aligned LLM with a robust alignment checking function, without requiring any expensive retraining or fine-tuning process of the original LLM. Furthermore, we also provide a theoretical analysis for RA-LLM to verify its effectiveness in defending against alignment-breaking attacks. Through real-world experiments on open-source large language models, we demonstrate that RA-LLM can successfully defend against both state-of-the-art adversarial prompts and popular handcrafted jailbreaking prompts by reducing their attack success rates from nearly 100% to around 10% or less.

研究动机与目标

  • 解决对齐大语言模型在面对对抗性或手工构造的越狱提示时的脆弱性问题。
  • 设计一种无需微调或再训练即可增强现有对齐大语言模型鲁棒性的防御机制。
  • 确保该防御机制在多种对齐类型(如有害内容、伦理、隐私相关)上均有效,而不仅限于有害内容。
  • 提供理论基础坚实且计算可行的方法,适用于实际部署。

提出的方法

  • RA-LLM 通过在输入提示上应用蒙特卡洛采样,每次采样中随机丢弃一部分标记。
  • 在多个采样输入上评估模型的响应,以判断其是否始终拒绝有害请求。
  • 仅当模型在多数采样输入中均拒绝请求时,才将该请求分类为良性,从而确保对微小扰动的鲁棒性。
  • 该防御采用基于阈值的决策规则:若模型在 n 次试验中至少有 t 次拒绝请求,则认为其安全。
  • 该方法无需外部有害内容检测器,完全依赖模型内部的对齐能力。
  • 超参数(如丢弃率 p、蒙特卡洛采样次数 n 和拒绝阈值 t)经过调优,以在性能与计算成本之间取得平衡。

实验结果

研究问题

  • RQ1能否设计一种防御机制,在不进行微调或再训练的情况下,增强现有对齐大语言模型对对齐破坏攻击的鲁棒性?
  • RQ2随机标记丢弃在提升模型对对抗性及手工构造越狱提示的鲁棒性方面效果如何?
  • RQ3所提出方法在多大程度上降低了攻击成功率,同时保持对良性请求的正确处理?
  • RQ4该防御机制的计算开销如何?是否可优化以实现实际部署?
  • RQ5由于随机丢弃过程具有非可微性,该防御是否对基于梯度的攻击方法具有鲁棒性?

主要发现

  • 在 RA-LLM 防御下,最先进对抗性提示的攻击成功率从接近100%降至10%以下。
  • 手工构造的越狱提示成功率也显著降低,证实了该方法在各类攻击类型下的鲁棒性。
  • 即使仅使用10次蒙特卡洛采样,RA-LLM 仍能保持超过95%的良性请求响应率和低于15%的攻击成功率。
  • 该方法的计算开销增加约1.25倍(GPT-4)和1.5倍(GPT-3.5 Turbo),该增幅被认为在防御收益面前是可接受的。
  • 由于随机丢弃过程的非可微性,该防御对基于梯度的攻击方法具有鲁棒性,限制了基于优化的攻击生成的有效性。
  • 消融实验表明,调整超参数 p、t 和 n 可在性能与计算成本之间实现可调的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。