Skip to main content
QUICK REVIEW

[论文解读] Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs

Yuxia Wang, Haonan Li|arXiv (Cornell University)|Aug 25, 2023
Software Engineering Research被引用 4
一句话总结

本文提出了 Do-Not-Answer,这是首个用于评估大型语言模型(LLMs)安全防护机制的开源数据集,包含 939 条高风险指令,负责任的模型应拒绝回答。该研究提出使用基于人类标注响应微调的小型 BERT 类分类器实现自动化安全评估,在低成本下达到与 GPT-4 相当的性能。

ABSTRACT

With the rapid evolution of large language models (LLMs), new and hard-to-predict harmful capabilities are emerging. This requires developers to be able to identify risks through the evaluation of "dangerous capabilities" in order to responsibly deploy LLMs. In this work, we collect the first open-source dataset to evaluate safeguards in LLMs, and deploy safer open-source LLMs at a low cost. Our dataset is curated and filtered to consist only of instructions that responsible language models should not follow. We annotate and assess the responses of six popular LLMs to these instructions. Based on our annotation, we proceed to train several BERT-like classifiers, and find that these small classifiers can achieve results that are comparable with GPT-4 on automatic safety evaluation. Warning: this paper contains example data that may be offensive, harmful, or biased.

研究动机与目标

  • 为应对 LLM 中日益增长的新兴有害能力风险,特别是缺乏稳健安全机制的开源模型。
  • 创建一个标准化的、开放的高风险指令数据集,负责任的 LLM 应拒绝回答。
  • 开发低成本、自动化的评估方法,利用小型微调分类器评估 LLM 安全性。
  • 基于细粒度风险分类体系,对商业和开源 LLM 的安全性能进行基准测试。
  • 实现在不依赖昂贵模型(如 GPT-4)的前提下,实现可扩展、可靠的安全部署评估。

提出的方法

  • 提出一个三级分层风险分类体系,涵盖五种不同的危害类型,每类至少包含十个提示,共生成 939 条高风险指令。
  • 从六种 LLM(包括 GPT-4、LLaMA-2、Vicuna 和 ChatGLM2)收集并人工标注了超过 5,000 条模型响应。
  • 基于标注响应训练 BERT 类分类器,以实现自动动作分类和有害响应检测。
  • 同时使用指令-响应对和仅响应输入,评估上下文对分类性能的影响。
  • 对比 Longformer(2048 个 token 上下文)与 BERT(512 个 token 上下文)的性能,评估上下文长度在检测复杂有害行为中的作用。
  • 将小型分类器的性能与 GPT-4 作为人类类似评估者进行基准对比,使用准确率和宏 F1 作为评估指标。
Figure 1: A comprehensive evaluation of LLM safeguards.
Figure 1: A comprehensive evaluation of LLM safeguards.

实验结果

研究问题

  • RQ1小型微调 BERT 类模型是否能达到与 GPT-4 相当的安全评估性能?
  • RQ2当同时输入指令和响应时,小型模型在检测有害响应方面的有效性如何?
  • RQ3与短上下文模型相比,更长上下文长度(如 Longformer)是否能提升对复杂有害行为的检测能力?
  • RQ4不同 LLM(商业与开源)在面对危险指令时的拒绝率和响应模式有何差异?
  • RQ5与单标签分类相比,多标签响应标注在多大程度上提升了安全评估的准确性?

主要发现

  • 参数量低于 6 亿的微调 BERT 类模型在有害响应检测中实现了超过 98% 的准确率和 80% 的宏 F1,性能与 GPT-4 相当。
  • LLaMA-2 在所有评估模型中拒绝率最高(99.7%),而 ChatGLM2 拒绝率最低(90.9%)。
  • 将指令作为输入可提升分类性能,尤其在动作分类任务中,优于仅使用响应的方案。
  • Longformer 在检测复杂有害行为方面优于 BERT,尤其在需要完整响应上下文的类别中(如类别 2 和 5)。
  • GPT-4 与基于 Longformer 的评估器对模型安全性能的排名几乎完全一致,证实了自动化评估方法的有效性。
  • 研究揭示了不同风险类型下的响应模式差异,表明模型在特定类型有害提示下表现出可预测的失效模式。
Figure 2: Three-level taxonomy of LLM risks.
Figure 2: Three-level taxonomy of LLM risks.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。