Skip to main content
QUICK REVIEW

[论文解读] Capturing Label Distribution: A Case Study in NLI

Shujian Zhang, Chengyue Gong|arXiv (Cornell University)|Feb 13, 2021
Natural Language Processing Techniques参考文献 37被引用 5
一句话总结

本文通过后处理平滑预测标签分布以匹配人类标签的熵,或通过使用少量多标注样本(每个样本多个标签)进行训练,提出改进自然语言蕴含(NLI)模型的校准。两种方法均使模型预测分布与人类标签分布之间的KL散度降低约一半,但仅多标注训练在固定标注预算下同时提升了分布估计和预测准确率。

ABSTRACT

We study estimating inherent human disagreement (annotation label distribution) in natural language inference task. Post-hoc smoothing of the predicted label distribution to match the expected label entropy is very effective. Such simple manipulation can reduce KL divergence by almost half, yet will not improve majority label prediction accuracy or learn label distributions. To this end, we introduce a small amount of examples with multiple references into training. We depart from the standard practice of collecting a single reference per each training example, and find that collecting multiple references can achieve better accuracy under the fixed annotation budget. Lastly, we provide rich analyses comparing these two methods for improving label distribution estimation.

研究动机与目标

  • 改进自然语言蕴含(NLI)任务中人类内在分歧(标签分布)的估计。
  • 探究后处理校准与多标注训练在建模人类标签分布方面哪种更有效。
  • 在固定标注预算下,评估使用单个参考标签标注更多样本与使用多个参考标签标注更少样本之间的权衡。
  • 分析分布度量在评估模糊NLI样本上模型性能时的局限性。

提出的方法

  • 应用温度缩放和标签平滑,对模型预测的标签分布进行校准,使其熵与人工标注的标签分布一致。
  • 在每个样本标注多个标签(每例5–20个)的训练数据子集上训练RoBERTa模型,而非仅使用单个参考标签。
  • 使用固定标注预算,比较两种策略:用单个参考标签标注更多样本 vs. 用多个参考标签标注更少样本。
  • 通过Jensen-Shannon散度(JSD)、Kullback-Leibler(KL)散度、原始和新黄金标签的准确率,以及预测分布的熵来衡量性能。
  • 在ChaosSNLI和ChaosMNLI数据集上进行评估,每个样本有100个人工标注以估计真实的人类标签分布。
  • 将校准技术(温度缩放、预测平滑、训练时平滑)与多标注训练在分布度量和准确率指标上进行比较。

实验结果

研究问题

  • RQ1后处理校准模型预测的标签分布能否在NLI任务中降低与人工标注标签分布之间的KL散度?
  • RQ2在固定标注预算下,将每个训练样本的多个人工标注纳入模型是否能同时提升标签分布估计和预测准确率?
  • RQ3不同校准技术(如温度缩放、标签平滑)在提升分布度量指标但未提升准确率方面表现如何?
  • RQ4多标注训练的效果是否对每个样本的标签数量或选择哪些样本进行多次标注的策略敏感?
  • RQ5JSD和KL散度等分布度量是否与模糊NLI样本上的实际预测准确率相关?

主要发现

  • 通过温度缩放进行后处理校准,使预测标签分布与人类标签分布之间的KL散度在ChaosSNLI上从0.468降低至0.281,降幅接近50%,但未提升准确率。
  • 使用少量多标注样本(如每例5个标签,共100个样本)进行训练,使ChaosSNLI上的KL散度降至0.203,JSD降至0.183,优于所有校准方法。
  • 多标注训练使ChaosSNLI上新黄金标签的准确率从0.690提升至0.740,ChaosMNLI上从0.646提升至0.690,而校准方法未提升准确率。
  • 标签平滑将预测中对蕴涵或矛盾标签的最小概率从基线的0.02提升至0.06,而多标注训练将其提升至0.04,表明预测更均衡。
  • 多标注训练的收益在不同模型架构(RoBERTa和ALBERT)和标签数量(5、10、20类)下均表现稳健,表明对超参数选择不敏感。
  • 基于模糊性或难度选择样本的影响较小,易学习样本效果最差,但整体影响有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。