[论文解读] Distributed NLI: Learning to Predict Human Opinion Distributions for Language Reasoning
本文提出了分布式自然语言蕴含(Distributed NLI),这是一个新的自然语言理解(NLU)任务,旨在预测人类判断的分布,而不仅限于单标签分类。通过应用分布估计方法——蒙特卡洛丢弃(MC Dropout)、深度集成(Deep Ensemble)、重新校准(Re-Calibration)和知识蒸馏(Distribution Distillation)——模型显著优于Softmax基线方法,其中重新校准在获得额外分布标注的情况下表现最佳,但性能仍远低于人类的上限。
We introduce distributed NLI, a new NLU task with a goal to predict the distribution of human judgements for natural language inference. We show that by applying additional distribution estimation methods, namely, Monte Carlo (MC) Dropout, Deep Ensemble, Re-Calibration, and Distribution Distillation, models can capture human judgement distribution more effectively than the softmax baseline. We show that MC Dropout is able to achieve decent performance without any distribution annotations while Re-Calibration can give further improvements with extra distribution annotations, suggesting the value of multiple annotations for one example in modeling the distribution of human judgements. Despite these improvements, the best results are still far below the estimated human upper-bound, indicating that predicting the distribution of human judgements is still an open, challenging problem with a large room for improvements. We showcase the common errors for MC Dropout and Re-Calibration. Finally, we give guidelines on the usage of these methods with different levels of data availability and encourage future work on modeling the human opinion distribution for language reasoning. Our code and data are publicly available at https://github.com/easonnie/ChaosNLI
研究动机与目标
- 正式化并定义一项新的NLU任务——分布式NLI,旨在预测自然语言蕴含任务中人类判断的完整分布,而非单一标签。
- 探究现有深度学习方法是否能有效建模NLI任务中人类标注的不确定性和变异性。
- 评估额外分布标注对模型预测人类判断分布性能的影响,并评估在低资源或分布外设置下进行分布感知建模的可行性。
- 根据数据可用性和标注资源,为选择分布估计方法提供指导。
- 指出当前方法的局限性,并鼓励未来在语言推理任务中对人类观点分布建模的研究。
提出的方法
- 将标准NLI任务改写为预测三个标签(蕴涵、中性、矛盾)的概率分布,而非单一预测标签。
- 应用四种分布估计技术:蒙特卡洛丢弃(MC Dropout)、深度集成(Deep Ensemble)、重新校准(Re-Calibration)和知识蒸馏(Distribution Distillation),以估计预测不确定性并提升分布校准性能。
- 使用蒙特卡洛丢弃方法,在测试时应用丢弃策略,通过多次前向传播采样,估计预测方差,从而形成预测结果的分布。
- 通过温度缩放方法在分布标注上进行训练,重新加权模型logits,实现重新校准,以提升置信度校准效果。
- 使用基于人类标注分布生成的软标签,通过交叉熵损失进行训练,实现知识蒸馏并提升泛化能力。
- 在域内和域外测试集上评估方法,使用KL散度和Brier评分等指标,比较预测分布与人工标注分布的差异。
实验结果
研究问题
- RQ1在仅使用单标签NLI数据进行训练的深度学习模型,能否有效预测NLI样本上人类判断的完整分布?
- RQ2在捕捉人类观点分布方面,不同分布估计方法(蒙特卡洛丢弃、深度集成、重新校准、知识蒸馏)的表现如何比较?
- RQ3额外的分布标注在多大程度上能提升模型预测人类判断分布的性能?
- RQ4这些方法在未进行域内微调的情况下,对域外测试集的泛化能力如何?
- RQ5蒙特卡洛丢弃和重新校准在分布预测中的常见失败模式和局限性是什么?
主要发现
- 所有四种分布估计方法——蒙特卡洛丢弃、深度集成、重新校准和知识蒸馏——在预测人类判断分布方面均显著优于标准Softmax基线方法。
- 蒙特卡洛丢弃在无需任何分布标注的情况下即表现出优异性能,证明其作为不确定性估计的即插即用方法的有效性。
- 在获得额外分布标注后,重新校准进一步提升了性能,成为所有测试方法中表现最佳者。
- 尽管性能有所提升,但表现最佳的模型(重新校准)与估计的人类上限仍有显著差距,表明该任务仍具挑战性。
- 蒙特卡洛丢弃和重新校准在未使用域内训练数据的情况下,对域外测试集表现出良好的泛化能力,表明其在不同领域间具有鲁棒性。
- 蒙特卡洛丢弃和重新校准的常见错误包括对中性判断的过度自信,以及在模糊或语用复杂的样本中未能捕捉到少数意见的变化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。