[论文解读] Ground-Truth, Whose Truth? -- Examining the Challenges with Annotating Toxic Text Datasets
本研究提出一种多标签标注方法,通过捕捉上下文相关的毒性并减少标注噪声,以提升毒性文本数据集的质量。对三个数据集进行重新标注的结果显示,多标签标注能提高与外部机器学习模型的一致性,并增强标注者内部的一致性,尽管并不一定改善传统的标注者间一致性指标。
The use of machine learning (ML)-based language models (LMs) to monitor content online is on the rise. For toxic text identification, task-specific fine-tuning of these models are performed using datasets labeled by annotators who provide ground-truth labels in an effort to distinguish between offensive and normal content. These projects have led to the development, improvement, and expansion of large datasets over time, and have contributed immensely to research on natural language. Despite the achievements, existing evidence suggests that ML models built on these datasets do not always result in desirable outcomes. Therefore, using a design science research (DSR) approach, this study examines selected toxic text datasets with the goal of shedding light on some of the inherent issues and contributing to discussions on navigating these challenges for existing and future projects. To achieve the goal of the study, we re-annotate samples from three toxic text datasets and find that a multi-label approach to annotating toxic text samples can help to improve dataset quality. While this approach may not improve the traditional metric of inter-annotator agreement, it may better capture dependence on context and diversity in annotators. We discuss the implications of these results for both theory and practice.
研究动机与目标
- 调查单标签标注在毒性文本数据集中存在的局限性,特别是与上下文依赖性和标注者偏见相关的问题。
- 评估多标签标注框架是否能够提升毒性文本分类的数据集质量并减少噪声。
- 探讨标注者的人口统计特征、上下文以及主观理解如何影响标签的一致性和可靠性。
- 为未来毒性文本数据集和标注协议的设计提供可操作的改进建议。
- 挑战将标注者间一致性作为数据集质量唯一指标的过度依赖,倡导采用上下文感知的标注方法。
提出的方法
- 采用设计科学研究(DSR)框架,识别毒性文本标注中的问题并开发解决方案。
- 使用多标签标注方案对三个主要毒性文本数据集(如 SBIC、Jigsaw、ToxiGen)各100个样本进行了重新标注。
- 采用结构化的标注指南,允许标注者为单个文本样本分配多个标签(例如:冒犯性、讽刺、偏见)。
- 通过标注者内部一致性以及与外部机器学习模型的对齐程度等指标,将多标签方法与传统单标签标注进行对比。
- 开展了一项初步的一致性实验,由五名标注者参与,以评估多标签框架下的标注者内部可靠性。
- 基于标注者的人口统计特征和上下文线索分析标签差异,尤其关注隐性或微妙的毒性。
实验结果
研究问题
- RQ1上下文在毒性文本标注中起什么作用?标注者在多大程度上因上下文模糊而产生分歧?
- RQ2与单标签标注相比,多标签标注框架是否能提升数据集质量并减少噪声?
- RQ3即使标注者间一致性未显著提高,多标签方法是否仍能提升标注者内部的一致性?
- RQ4标注者的人口统计特征和文化背景在判断冒犯性或隐性毒性内容时如何影响标注决策?
- RQ5现有数据集在多大程度上因缺乏上下文信息和刚性单标签限制而反映出标注偏见?
主要发现
- 在单标签方案下,具有隐性毒性(如讽刺或反语)的文本样本即使被原始标注者标记为冒犯性,也经常被错误分类。
- 多标签方法提高了与外部机器学习模型的一致性,表明其能更好地表征复杂毒性维度。
- 在多标签框架下,标注者内部一致性有所提高,表明允许标注者分配多个标签可增强个体标注者的可靠性。
- 标注者间一致性未因多标签标注而显著提升,挑战了‘更高的一致性即代表更高数据质量’的假设。
- 来自代表性不足群体的标注者更可能拒绝最终标签,凸显了文化与语言背景在毒性感知中的作用。
- 大量冒犯性内容缺乏明确的有毒关键词,而是依赖语气、暗示或上下文,使得基于关键词的模型难以检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。