Skip to main content
QUICK REVIEW

[论文解读] ConvAbuse: Data, Analysis, and Benchmarks for Nuanced Abuse Detection in Conversational AI

Amanda Cercas Curry, Gavin Abercrombie|arXiv (Cornell University)|Sep 20, 2021
Hate Speech and Cyberbullying Detection参考文献 30被引用 5
一句话总结

本文介绍了 ConvAbuse,这是首个公开的英文对话式人工智能系统滥用语言语料库,数据源自与三款不同人工智能机器人的真实互动。该研究提出了一套细致的标注方案,揭示超过一半的滥用言论具有性暗示或性别歧视特征,并对现有模型进行了基准测试,结果显示 F1 分数低于 90%,表明在人工智能-人类互动的滥用检测方面仍有巨大改进空间。

ABSTRACT

We present the first English corpus study on abusive language towards three conversational AI systems gathered "in the wild": an open-domain social bot, a rule-based chatbot, and a task-based system. To account for the complexity of the task, we take a more `nuanced' approach where our ConvAI dataset reflects fine-grained notions of abuse, as well as views from multiple expert annotators. We find that the distribution of abuse is vastly different compared to other commonly used datasets, with more sexually tinted aggression towards the virtual persona of these systems. Finally, we report results from bench-marking existing models against this data. Unsurprisingly, we find that there is substantial room for improvement with F1 scores below 90%.

研究动机与目标

  • 为解决人类-人工智能对话中滥用检测缺乏真实世界、公开可用数据集的问题。
  • 探究具有女性角色的对话式人工智能系统所遭受的滥用行为的性质与分布特征。
  • 开发一种细粒度的标注方案,以捕捉包括性别化与性暗示攻击在内的细微滥用形式。
  • 在真实的人机互动数据上对现有滥用检测模型进行基准测试,以评估其性能差距。
  • 通过发布专家标注的数据并倡导多样化的标注者视角,推动伦理且具代表性的滥用检测研究。

提出的方法

  • 从三款真实对话式人工智能系统中收集了 20,000 条用户发言:一款开放领域的社交机器人、一款基于规则的聊天机器人,以及一款任务导向型助手。
  • 设计了一套多层级的标注方案,由专家标注者参与,从严重程度、意图和形式(如性暗示、性别歧视、一般攻击)等维度对滥用行为进行分类。
  • 采用基于共识的标注流程,并通过标注者间一致性检查确保可靠性,同时捕捉多样化的观点。
  • 发布 4,000 个标注示例的子集及全部代码,以支持可复现性与进一步研究。
  • 使用标准指标(如 F1)在 ConvAbuse 数据集上对最先进滥用检测模型(如基于 BERT 的分类器)进行基准测试。
  • 开展定性分析,以探索滥用行为的模式,特别是针对人工智能角色的性别化与性暗示语言的普遍性。

实验结果

研究问题

  • RQ1对话式人工智能系统所遭受的滥用分布与社交媒体数据集中观察到的有何不同?
  • RQ2针对具有女性角色的 AI 系统的滥用行为的主要形式是什么?这些形式如何反映社会中更广泛的厌女现象?
  • RQ3现有滥用检测模型在真实人机互动数据上的泛化能力如何?它们在哪些方面存在失败?
  • RQ4在标注过程中引入多位专家视角在多大程度上提升了滥用检测数据集的可靠性与细致程度?
  • RQ5在标注与建模人机互动中的滥用行为时,会面临哪些伦理与代表性挑战?如何加以缓解?

主要发现

  • ConvAbuse 数据集中超过一半的滥用言论包含性别歧视或性骚扰元素,表明针对人工智能的滥用行为具有显著的性别化特征。
  • 对话式人工智能中的滥用分布与社交媒体数据集存在显著差异,性别化与性暗示攻击的出现频率更高。
  • 现有滥用检测模型在 ConvAbuse 数据集上的 F1 分数低于 90%,表明在检测细微滥用形式方面仍有巨大改进空间。
  • 标注过程揭示,对发言者人口统计特征(尤其是性别与种族)的假设会显著影响标注结果,凸显了多样化标注者群体的必要性。
  • 该数据集的作者多样性高于许多现有数据集,降低了少数高产施虐者带来的偏差风险。
  • 在数据收集与标注过程中识别出伦理挑战,包括标注者面临的心理健康风险,以及对非有意识系统实施滥用行为的道德模糊性;作者通过透明、伦理的数据实践应对这些问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。