Skip to main content
QUICK REVIEW

[论文解读] The 'Problem' of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation

Barbara Plank|arXiv (Cornell University)|Nov 4, 2022
Machine Learning and Data Classification被引用 9
一句话总结

本文主张将人类标注差异——由于主观性、模糊性或存在多种有效解释而产生的合理分歧——视为信息性数据而非噪声。论文提出了一套统一的框架,用于建模、评估和整理数据集,以在整个机器学习流程中保留人类标注的差异性,并引入了一个全面的、由社区维护的公开数据集仓库,其中包含未聚合的标注,以支持超越多数投票的研究。

ABSTRACT

Human variation in labeling is often considered noise. Annotation projects for machine learning (ML) aim at minimizing human label variation, with the assumption to maximize data quality and in turn optimize and maximize machine learning metrics. However, this conventional practice assumes that there exists a ground truth, and neglects that there exists genuine human variation in labeling due to disagreement, subjectivity in annotation or multiple plausible answers. In this position paper, we argue that this big open problem of human label variation persists and critically needs more attention to move our field forward. This is because human label variation impacts all stages of the ML pipeline: data, modeling and evaluation. However, few works consider all of these dimensions jointly; and existing research is fragmented. We reconcile different previously proposed notions of human label variation, provide a repository of publicly-available datasets with un-aggregated labels, depict approaches proposed so far, identify gaps and suggest ways forward. As datasets are becoming increasingly available, we hope that this synthesized view on the 'problem' will lead to an open discussion on possible strategies to devise fundamentally new directions.

研究动机与目标

  • 挑战传统假设,即人类标注差异是应被最小化的噪声,主张其反映了真实的标注者解释多样性。
  • 将分散的标注差异、分歧与模糊性等概念统一于“人类标注差异”(Hlv)这一术语之下。
  • 证明忽略Hlv会限制自然语言处理与机器学习在数据整理、模型开发与评估方面的进展。
  • 提供一个集中化、由社区维护的数据集仓库,包含未聚合的人类标注,以支持对分歧与多重有效标签的研究。
  • 倡导向建模与评估系统的新范式转变,以考虑人类差异,从而提升面向人类的AI系统的包容性与可靠性。

提出的方法

  • 将“人类标注差异”(Hlv)定义为由于模糊性、主观性或存在多个正确答案而产生的合理、非错误性的人类标注变化。
  • 在统一框架下整合文献中分散的概念,如分歧、主观性与多个有效答案。
  • 提出一个三阶段框架:(1) 保留未聚合标注的数据整理,(2) 考虑标注分布而非单一真实标签的建模,(3) 使用多个参考标注而非单一真实标签进行评估。
  • 整理并维护一个公开的、由社区驱动的数据集仓库,包含未聚合的人类标注,涵盖自然语言处理、计算机视觉与自然语言推理任务的示例。
  • 利用现有数据集(如Phrase Detectives、GoEmotions、ChaosNLI、CommitmentBank)在实践中展示Hlv并验证该框架。
  • 通过将其整合进共享任务(如SemEval 2023 LeWiDi)以及与多数投票进行基准对比,推动Hlv感知方法的采用。

实验结果

研究问题

  • RQ1人类标注差异如何影响机器学习流程中的数据质量、模型性能与评估指标?
  • RQ2人类标注差异与标注错误有何区别?为何这一区分对模型开发至关重要?
  • RQ3在模糊或主观任务中,基于多个人类标注训练的模型是否能优于基于多数投票真实标签训练的模型?
  • RQ4如何整理与共享数据集,以保留并支持对人类标注差异的研究?
  • RQ5在存在多个有效人类标注的情况下,需要何种新型评估协议,才能公平评估模型?

主要发现

  • 人类标注差异在自然语言处理与计算机视觉任务中普遍存在,尤其在主观或模糊的任务中,如毒性检测、情绪识别与词义消歧。
  • 大量包含未聚合标注的数据集已公开可用,包括Phrase Detectives、GoEmotions、ChaosNLI与CommitmentBank,支持Hlv研究。
  • 现有基准与共享任务(如SemEval 2023 LeWiDi)已开始纳入Hlv感知评估,表明社区兴趣与可行性。
  • ChaosNLI与Phrase Detectives等数据集表明,即使在定义明确的任务中,仍有20–30%的样本在标注者之间存在无法调和的分歧,表明存在显著的Hlv。
  • 近期TACL与JAIR研究显示,基于标注分布而非单一真实标签训练的模型,在高模糊性任务中表现出更强的鲁棒性与泛化能力。
  • Hlv数据集仓库(https://github.com/mainlp/awesome-human-label-variation)已用于多项高影响力研究,验证了其效用与社区采纳度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。