[论文解读] SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
本文对102个用于评估和提升大语言模型(LLM)安全性的开放数据集进行了系统性综述,识别出若干趋势,包括合成数据集和专业数据集的兴起、英语资源的主导地位,以及在实践中对较新数据集的利用不足。主要贡献在于建立了SafetyPrompts.com的动态社区维护目录,以标准化并提升研究界与产业界在LLM安全评估方面的实践。
The last two years have seen a rapid growth in concerns around the safety of large language models (LLMs). Researchers and practitioners have met these concerns by creating an abundance of datasets for evaluating and improving LLM safety. However, much of this work has happened in parallel, and with very different goals in mind, ranging from the mitigation of near-term risks around bias and toxic content generation to the assessment of longer-term catastrophic risk potential. This makes it difficult for researchers and practitioners to find the most relevant datasets for their use case, and to identify gaps in dataset coverage that future work may fill. To remedy these issues, we conduct a first systematic review of open datasets for evaluating and improving LLM safety. We review 144 datasets, which we identified through an iterative and community-driven process over the course of several months. We highlight patterns and trends, such as a trend towards fully synthetic datasets, as well as gaps in dataset coverage, such as a clear lack of non-English and naturalistic datasets. We also examine how LLM safety datasets are used in practice -- in LLM release publications and popular LLM benchmarks -- finding that current evaluation practices are highly idiosyncratic and make use of only a small fraction of available datasets. Our contributions are based on SafetyPrompts.com, a living catalogue of open datasets for LLM safety, which we plan to update continuously as the field of LLM safety develops.
研究动机与目标
- 解决LLM安全数据集领域碎片化且迅速增长的问题,该问题阻碍了研究人员为特定安全目标选择相关数据集。
- 识别数据集创建、格式、语言覆盖范围和许可方面的关键趋势、缺口和模式,以指导未来数据集的开发。
- 评估开放安全数据集在模型发布论文和主流LLM基准测试中的当前使用情况,以揭示不一致性和利用不足的问题。
- 在SafetyPrompts.com建立一个持续更新的开放LLM安全数据集动态目录,以支持标准化并改善评估实践。
- 突出显示现代安全数据集的可用性与其实际在现实世界模型评估中的使用之间的脱节,呼吁加强标准化。
提出的方法
- 在2018年6月至2024年2月期间,通过学术论文、GitHub和Hugging Face对开放数据集进行了系统性、社区驱动的搜索,以识别与LLM安全相关的数据集。
- 应用严格的纳入标准:仅文本数据集、与安全相关(如偏见、毒性、对齐性、越狱攻击)、可通过GitHub或Hugging Face获取,且无许可或语言限制。
- 从关键维度分析了102个数据集:目的、创建方式(如合成、真实世界)、格式、规模、访问方式、许可协议和发表历史。
- 绘制了125篇模型发布论文和10个主流LLM基准测试中的数据集使用情况,以评估实际采用模式。
- 根据安全关注点(如社会人口学偏见、毒性生成、权力追求行为)对数据集进行分类,并评估语言多样性和合成数据的普遍性。
- 在SafetyPrompts.com持续维护一个动态、公开可访问的数据集目录,定期更新新数据集的收录和元数据。
实验结果
研究问题
- RQ1在LLM安全开放数据集的创建与设计中,主导趋势是什么,特别是在数据模态、语言和合成数据与真实世界数据源方面?
- RQ2开放安全数据集当前在模型发布论文和既定LLM基准测试中是如何使用的,其使用范围在多大程度上反映了现有数据集的多样性?
- RQ3当前数据集覆盖的主要缺口是什么,特别是在语言多样性方面,以及与新兴安全风险(如阿谀奉承或权力追求行为)的对齐程度?
- RQ4为何新高质量安全数据集的可用性与它们在主流评估实践中的采纳之间存在持续脱节?
- RQ5如何通过充分利用现有开放数据集的全部广度,实现LLM安全评估实践的标准化?
主要发现
- 开放LLM安全数据集的创建速度前所未有,超过一半(51个)的102个数据集是在2023年或之后发布的。
- 存在强烈的完全合成数据集趋势,尤其在针对特定安全评估(如红队测试、越狱攻击、对齐性测试)中。
- 英语在数据集领域占据主导地位,明显缺乏非英语安全数据集,特别是来自非美国机构的数据集。
- 尽管现代数据集可用,但模型发布论文和基准测试仍主要依赖2021–2022年的旧数据集(如BOLD和ToxiGen),这些数据集已无法反映当前LLM的行为特征。
- 无论是模型发布还是基准测试,评估实践都高度个性化,数据集使用重叠极少,表明缺乏标准化。
- 本综述识别出显著机会:通过将更新、更具上下文相关性的数据集整合到主流基准测试和发布评估中,可显著提升LLM安全评估质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。