Skip to main content
QUICK REVIEW

[论文解读] HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Mantas Mazeika, Long Phan|arXiv (Cornell University)|Feb 6, 2024
Complex Systems and Decision Making被引用 20
一句话总结

HarmBench 提供一个标准化的大规模自动化红队评估基准,用于对 LLM 进行自动化红队测试,并引入一种高效的对抗训练方法(R2D2)以提高对鲁棒拒绝的能力。

ABSTRACT

Automated red teaming holds substantial promise for uncovering and mitigating the risks associated with the malicious use of large language models (LLMs), yet the field lacks a standardized evaluation framework to rigorously assess new methods. To address this issue, we introduce HarmBench, a standardized evaluation framework for automated red teaming. We identify several desirable properties previously unaccounted for in red teaming evaluations and systematically design HarmBench to meet these criteria. Using HarmBench, we conduct a large-scale comparison of 18 red teaming methods and 33 target LLMs and defenses, yielding novel insights. We also introduce a highly efficient adversarial training method that greatly enhances LLM robustness across a wide range of attacks, demonstrating how HarmBench enables codevelopment of attacks and defenses. We open source HarmBench at https://github.com/centerforaisafety/HarmBench.

研究动机与目标

  • 激发对一个标准化、可扩展框架的需求,用于评估对 LLMs 的自动化红队。
  • 设计 HarmBench 以在红队评估中实现覆盖面广、可比性强和鲁棒性指标完善。
  • 提供跨越多样化行为、模型和防御的大规模、可重复评估。
  • 通过一种高效的对抗训练方法展示攻击与防御的协同开发。

提出的方法

  • 将 attack success rate (ASR) 定义为红队评估有效性的主要指标。
  • 在文本和多模态模态上精心挑选 510 种有害行为,分为验证集和测试集。
  • 标准化评估流程:生成测试用例、使用贪婪解码产生模型输出,并使用鲁棒分类器进行评估。
  • 为版权相关行为开发基于哈希的分类器,以及针对其他有害行为的微调非版权分类器,以计算 ASR。
  • 引入 Robust Refusal Dynamic Defense (R2D2),一种对抗训练框架,通过持久化测试池更新测试用例并优化模型拒绝。
  • 使用基于 GCG 的对手方并具持久化测试用例,以实现高效对抗训练并最大化鲁棒性。

实验结果

研究问题

  • RQ1如何标准化自动化红队评估,以实现跨方法和模型的公平、大规模比较?
  • RQ2模型规模、训练程序和防御策略对对自动化红队的鲁棒性有何影响?
  • RQ3结合自动化红队的对抗训练(R2D2)是否能在不损害通用能力的前提下提升模型拒绝能力?
  • RQ4相较于标准文本攻击,情境化和多模态有害行为如何影响 ASR 与防御效果?
  • RQ5是否有证据表明在不同模型家族中,鲁棒性与模型大小无关?

主要发现

  • 没有单一的攻击或防御对所有模型和行为都同样有效。
  • 鲁棒性在很大程度上与模型大小无关,但在模型家族和训练方案上差异显著。
  • 情境化和多模态有害行为的平均 ASR 高于一些非情境性有害行为,而版权有害因更严格的基于哈希的版权检测而显示较低的 ASR。
  • 在他们的实验中,R2D2 在模型级防御中对 GCG 攻击实现了最先进的鲁棒性。
  • 使用自动化红队的对抗训练可以在多样化攻击中显著降低 ASR,而对 MT-Bench 的通用知识表现影响不大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。