[论文解读] Six Attributes of Unhealthy Conversation
本文介绍了不健康评论语料库(UCC),这是一个包含约44,000条由众包人员标注的在线评论的大规模数据集,针对六种微妙但非毒性却有害的对话属性进行标注:敌意、对抗性、轻视、居高临下、讽刺和不公平概括。通过置信度分数和多属性分类体系,该研究实现了对明显毒性之外的不健康话语的改进检测,微调后的BERT模型在性能上超越了众包标注者的共识。
We present a new dataset of approximately 44000 comments labeled by crowdworkers. Each comment is labelled as either 'healthy' or 'unhealthy', in addition to binary labels for the presence of six potentially 'unhealthy' sub-attributes: (1) hostile; (2) antagonistic, insulting, provocative or trolling; (3) dismissive; (4) condescending or patronising; (5) sarcastic; and/or (6) an unfair generalisation. Each label also has an associated confidence score. We argue that there is a need for datasets which enable research based on a broad notion of 'unhealthy online conversation'. We build this typology to encompass a substantial proportion of the individual comments which contribute to unhealthy online conversation. For some of these attributes, this is the first publicly available dataset of this scale. We explore the quality of the dataset, present some summary statistics and initial models to illustrate the utility of this data, and highlight limitations and directions for further research.
研究动机与目标
- 为解决现有针对微妙、非明显毒性但有害的在线行为的大规模高质量数据集缺乏的问题。
- 构建超越明显毒性的“不健康”对话属性的综合性分类体系。
- 支持自动化内容审核、用户引导以及上下文感知对话质量评估的研究。
- 通过高质量、带有置信度分数的标注,提升模型对微妙在线不文明行为的检测性能。
- 揭示数据收集和标注过程中存在的偏见,以指导未来在公平性和代表性方面的研究。
提出的方法
- 众包人员对来自加拿大新闻网站的评论标注了六种不健康对话的子属性:敌意、对抗性、轻视、居高临下、讽刺和不公平概括。
- 每个标签均分配了一个介于0.5至1.0之间的置信度分数,以反映标注者的确定程度。
- 标注者通过一个仅提供有限人口统计信息的平台进行筛选,并使用可信度评分对标签进行加权。
- 使用该数据集对微调后的BERT模型进行训练和评估,以建立基线性能。
- 将数据集开源发布于GitHub,以支持可复现性和进一步研究。
- 质量控制包括标注者间一致性检查以及标签一致性的验证。
实验结果
研究问题
- RQ1多属性分类体系是否能有效捕捉在线对话中微妙但非毒性却有害的行为?
- RQ2在真实世界评论数据中,这六种不健康属性与明显毒性以及其他属性之间的相关性如何?
- RQ3机器学习模型(如微调后的BERT)在检测这些细微属性方面,能在多大程度上超越人类共识?
- RQ4标注者的人口统计特征和上下文呈现方式的偏见如何影响标签的可靠性与模型的泛化能力?
- RQ5该数据集中存在哪些关键局限性和非预期偏见,可能影响内容审核系统在现实世界中的部署?
主要发现
- UCC包含约44,000条评论,每条评论对六种不健康对话属性具有二值标签及相应的置信度分数,是目前此类数据集中规模最大的之一。
- 这六种属性与明显毒性基本独立,表明它们代表了不健康话语的不同维度。
- 微调后的BERT模型性能超过众包标注者共识,表明其在自动化检测方面具有强大潜力。
- 对于复杂且主观的属性,标注者间的一致性较低,凸显了对微妙语言行为进行一致标注的挑战。
- 该数据集显示,轻视和不公平概括在现有数据集中普遍存在但记录不足,凸显了本语料库的创新性。
- 标注者可信度评分提升了标签的可靠性,证明在主观任务的众包中引入置信度度量具有重要价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。