Skip to main content
QUICK REVIEW

[论文解读] What Can We Learn from Collective Human Opinions on Natural Language Inference Data?

Yixin Nie, Xiang Zhou|arXiv (Cornell University)|Oct 7, 2020
Topic Modeling参考文献 37被引用 4
一句话总结

该论文提出了ChaosNLI,一个大规模数据集,包含在4,645个NLI样本上由人类标注的464,500个标注结果,揭示了即使在广泛使用的NLI基准数据集(如SNLI、MNLI和αNLI)中,人类标注的高分歧性依然普遍存在。研究发现,当前最先进模型在低分歧性样本上的表现接近随机水平——而这些样本正是错误发生的主要来源——凸显了仅依赖多数标签评估方法的局限性,并主张应基于人类意见的完整分布而非单一黄金标签来评估模型性能。

ABSTRACT

Despite the subjective nature of many NLP tasks, most NLU evaluations have focused on using the majority label with presumably high agreement as the ground truth. Less attention has been paid to the distribution of human opinions. We collect ChaosNLI, a dataset with a total of 464,500 annotations to study Collective HumAn OpinionS in oft-used NLI evaluation sets. This dataset is created by collecting 100 annotations per example for 3,113 examples in SNLI and MNLI and 1,532 examples in Abductive-NLI. Analysis reveals that: (1) high human disagreement exists in a noticeable amount of examples in these datasets; (2) the state-of-the-art models lack the ability to recover the distribution over human labels; (3) models achieve near-perfect accuracy on the subset of data with a high level of human agreement, whereas they can barely beat a random guess on the data with low levels of human agreement, which compose most of the common errors made by state-of-the-art models on the evaluation sets. This questions the validity of improving model performance on old metrics for the low-agreement part of evaluation datasets. Hence, we argue for a detailed examination of human agreement in future data collection efforts, and evaluating model outputs against the distribution over collective human opinions. The ChaosNLI dataset and experimental scripts are available at https://github.com/easonnie/ChaosNLI

研究动机与目标

  • 调查标准NLI数据集中人类意见的分布情况,挑战‘多数标签即真实标签’的假设。
  • 评估当前最先进NLU模型是否能够捕捉人类标注的完整分布,而不仅仅是预测多数标签。
  • 评估模型性能是否与人类一致水平相关,以及低分歧性样本是否构成模型错误的主要来源。
  • 倡导将评估方式从多数标签准确率转向建模集体人类判断的分布,特别是在实用性和主观性较强的NLU任务中。

提出的方法

  • 在SNLI和MNLI匹配数据集的3,113个样本以及αNLI的1,532个样本上,每例收集100个标注,共获得464,500个标注结果。
  • 通过计算每例的人类标签分布的熵来量化人类一致水平,将其作为样本难度的代理指标。
  • 在相同的NLI任务上,使用标准分类头训练并评估当前最先进模型(如BERT、RoBERTa、XLNet、ALBERT、DistilBERT、BART)。
  • 使用标准准确率以及分布性度量(如Jensen-Shannon散度(JSD)和Kullback–Leibler(KL)散度)来衡量模型性能,其中比较模型Softmax输出与人类标注分布的经验分布。
  • 根据熵(即一致水平)对数据集进行分箱处理,并在各分箱内比较模型的准确率和分布相似性。
  • 分析模型间的共通错误,识别失败模式,尤其关注低分歧性样本上的表现。

实验结果

研究问题

  • RQ1当使用显著更多的标注者对标准NLI数据集(如SNLI、MNLI和αNLI)进行标注时,高人类分歧性在多大程度上普遍存在?
  • RQ2当前最先进NLU模型在多大程度上能够预测人类标注的完整分布,而不仅仅是多数标签?
  • RQ3模型性能是否与人类一致水平相关?模型在人类分歧性较低的样本上是否表现显著更差?
  • RQ4当前最先进模型最常见的错误是否主要集中在人类分歧性较低的样本上,表明这些样本是当前最具挑战性的案例?
  • RQ5基于集体人类意见分布而非仅多数标签准确率来评估模型,是否能提供更可靠、更具信息量的基准?

主要发现

  • 即使在每例样本有100个标注的情况下,αNLI、SNLI和MNLI匹配数据集中仍有10%至31%的样本存在高人类分歧性,挑战了多数标签作为真实标签的有效性。
  • 当前最先进模型在高分歧性样本上的准确率接近完美(最高达0.9),但在最低分歧性分箱中的表现却处于或低于随机水平(约0.5),表明其在模糊案例上的泛化能力存在根本性缺陷。
  • 即使模型在多数标签上取得了高准确率,其对人类意见分布的捕捉能力仍较差,表现为Jensen-Shannon散度(JSD)和KL散度均较高。
  • 当前最先进模型的共通错误主要集中于数据集中分歧性较低的子集,表明该子集构成了当前NLU评估的核心挑战。
  • 人类一致水平是模型难度的强指标,且与模型预测的不确定性密切相关,支持其作为模型校准和可靠性诊断工具的使用价值。
  • 与仅依赖多数标签相比,基于人类意见完整分布的评估揭示了模型能力的显著差距,尤其是在实用推理和主观推理任务中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。