Skip to main content
QUICK REVIEW

[论文解读] Soft Label Memorization-Generalization for Natural Language Inference

John P. Lalor, Hao Wu|arXiv (Cornell University)|Feb 27, 2017
Multimodal Machine Learning Applications参考文献 28被引用 5
一句话总结

本文提出了一种软标签记忆-泛化(Soft Label Memorization-Generalization, SLMG)微调方法,通过在少量训练数据中引入反映人类标注者不确定性的标签分布(即软标签),提升深度神经网络在自然语言蕴涵(NLI)任务中的泛化能力。尽管仅使用了SNLI训练集0.03%的数据作为软标签数据,SLMG在多个DNN模型上均显著提升了测试准确率,表明建模标签模糊性可超越标准硬标签训练,有效提升泛化性能。

ABSTRACT

Often when multiple labels are obtained for a training example it is assumed that there is an element of noise that must be accounted for. It has been shown that this disagreement can be considered signal instead of noise. In this work we investigate using soft labels for training data to improve generalization in machine learning models. However, using soft labels for training Deep Neural Networks (DNNs) is not practical due to the costs involved in obtaining multiple labels for large data sets. We propose soft label memorization-generalization (SLMG), a fine-tuning approach to using soft labels for training DNNs. We assume that differences in labels provided by human annotators represent ambiguity about the true label instead of noise. Experiments with SLMG demonstrate improved generalization performance on the Natural Language Inference (NLI) task. Our experiments show that by injecting a small percentage of soft label training data (0.03% of training set size) we can improve generalization performance over several baselines.

研究动机与目标

  • 通过建模标签不确定性而非将其视为噪声,提升NLP模型的泛化能力。
  • 探究少量软标签数据是否能提升深度学习模型在NLI任务中的性能。
  • 开发一种实用的微调框架,利用现有软标签分布,无需进行完整重训练。
  • 证明编码人类模糊性的软标签可超越标准硬标签微调和数据增强方法。

提出的方法

  • SLMG框架在少量经过软标签增强的训练数据上微调预训练的DNN模型,软标签源自众包标注。
  • 每个前提-假设对的软标签由1,000名Amazon Mechanical Turk(AMT)标注员的标注构建,形成对三种NLI类别(蕴涵、矛盾、中性)的概率分布。
  • 模型使用考虑软标签分布的交叉熵损失进行训练,使梯度反映不确定性,而非强制模型做出硬预测。
  • 该方法仅使用极小比例(0.03%)的软标签样本作为补充训练集,在更大规模的硬标签数据集基础上进行微调。
  • 该方法假设标签分歧反映的是模糊性而非噪声,并利用此特性通过避免预测中的过度自信来减少过拟合。
  • 该框架在SNLI数据集上使用三种不同的DNN架构进行评估,与标准微调和数据增强基线方法进行比较。

实验结果

研究问题

  • RQ1将反映人类标注者不确定性的软标签引入,能否提升NLI模型的泛化能力?
  • RQ2仅使用极小比例的软标签数据(0.03%)是否能带来相对于标准硬标签训练的可测量性能提升?
  • RQ3SLMG与使用额外未标注数据进行微调的数据增强基线方法相比表现如何?
  • RQ4编码模糊性的软标签能否减少过拟合并提升深度神经网络在测试集上的准确率?
  • RQ5在何种条件下,SLMG在模型不确定性与标签分布方面能带来最大的性能增益?

主要发现

  • SLMG在SNLI基准测试中,即使仅使用0.03%的训练数据进行软标签标注,也显著提升了三种不同DNN模型的测试集准确率。
  • 该方法优于使用额外未标注数据进行微调的强基线方法,表明在此设置下,软标签信息比原始数据量更具有效性。
  • 使用软标签微调的模型表现出更少的过拟合现象,因为软标签分布可防止模型对模糊样本的预测概率被推向极端值(1.0)。
  • 性能增益在人类标注者分歧较高的困难样本上最为显著,表明软标签能有效捕捉任务难度。
  • 结果表明,编码人类模糊性的软标签可作为一种归纳偏置,即使仅应用于极小部分训练数据,也能提升泛化能力。
  • 本研究提供了实证证据,表明当正确建模时,标签不确定性是NLP训练中的宝贵信号,而非噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。