[论文解读] DICES Dataset: Diversity in Conversational AI Evaluation for Safety
DICES数据集引入了一个大规模、人口统计学多样化的基准,用于评估对话式人工智能的安全性,涵盖了1,340次人机对话中超过250万条评分,包含细粒度的评分者人口统计信息和高复现性(每段对话70至120条评分)。该数据集支持对主观安全感知、评分者意见分歧以及安全判断中交叉性人口统计因素影响的深入分析,挑战了传统‘黄金标签’的假设,并为包容性、抗偏见的模型评估奠定了基础。
Machine learning approaches often require training and evaluation datasets with a clear separation between positive and negative examples. This risks simplifying and even obscuring the inherent subjectivity present in many tasks. Preserving such variance in content and diversity in datasets is often expensive and laborious. This is especially troubling when building safety datasets for conversational AI systems, as safety is both socially and culturally situated. To demonstrate this crucial aspect of conversational AI safety, and to facilitate in-depth model performance analyses, we introduce the DICES (Diversity In Conversational AI Evaluation for Safety) dataset that contains fine-grained demographic information about raters, high replication of ratings per item to ensure statistical power for analyses, and encodes rater votes as distributions across different demographics to allow for in-depth explorations of different aggregation strategies. In short, the DICES dataset enables the observation and measurement of variance, ambiguity, and diversity in the context of conversational AI safety. We also illustrate how the dataset offers a basis for establishing metrics to show how raters' ratings can intersects with demographic categories such as racial/ethnic groups, age groups, and genders. The goal of DICES is to be used as a shared resource and benchmark that respects diverse perspectives during safety evaluation of conversational AI systems.
研究动机与目标
- 为解决对话式人工智能安全评估中缺乏多样、代表性视角的问题,特别是考虑到安全具有文化和社会语境性。
- 超越简单的‘真实标签’假设,通过捕捉安全判断中意见的差异性、模糊性和多样性。
- 提供一个支持统计功效并可深入分析人口统计因素(种族/族裔、年龄、性别)如何影响安全判断的基准。
- 支持开发能够考虑安全的多元观点而非强制统一标准的微调与评估方法。
- 通过展示评分者意见分歧的显著性及其对数据集质量和模型训练的影响,挑战传统‘黄金标签’的概念。
提出的方法
- 数据集从性别、年龄和种族/族裔群体上均经过精心平衡的评分者群体中收集安全评分,以确保人口统计代表性。
- DICES-990(990段对话)和DICES-350(350段对话)中的每段对话均获得70至120条评分,从而实现高统计功效,并支持对变异性的重采样估计。
- 评分涵盖五个安全类别:伤害、偏见、错误信息、政治和政策违规,其中还包含特定类型(如仇恨言论)的子评分。
- 评分者的投票以人口统计群体为单位进行编码,支持多层贝叶斯建模,以分析意见分歧和交叉性效应。
- 包含专家标注的安全性、伤害性及伤害程度信息,支持与群体评分的对比分析。
- 数据集支持通过时间序列和行为数据对意见分歧指标和评分者行为进行分析,以检测异常值和噪声。

实验结果
研究问题
- RQ1不同人口统计群体(如种族、年龄、性别)在对话式人工智能输出的安全感知上是否存在差异?
- RQ2评分者多样性在多大程度上导致了更高的安全判断分歧?这种分歧在统计上如何建模?
- RQ3交叉性身份(如年轻非裔女性)与单一维度分组相比,如何影响安全感知?
- RQ4当评分者意见分歧较高时,专家标注能否与群体评分进行有意义的比较?
- RQ5高评分者复现率对估计变异性和提升模型评估稳健性有何影响?
主要发现
- DICES数据集包含来自近300名评分者的超过250万条评分,覆盖1,340段对话,每段对话有70至120条评分,远超典型3至5名评分者的标准。
- 评分者意见分歧显著,表明安全评估具有高度主观性,挑战了单一‘黄金标签’在安全评估中的可行性。
- 并非所有人口统计群体在影响安全感知方面发挥同等作用,部分子群体在评分中表现出更强或更一致的模式。
- 交叉性群体(如年轻非裔女性)揭示了独特的安全感知模式,表明单一维度的人口统计分析可能遗漏关键洞察。
- 高复现率支持稳健的重采样和更优的变异估计,有助于在安全评估研究中实现更可靠的统计推断。
- 专家评分与群体评分存在差异,凸显了需要开发能够整合多元视角的方法,而非默认采用专家共识。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。