Skip to main content
QUICK REVIEW

[论文解读] Counterfactually-Augmented SNLI Training Data Does Not Yield Better Generalization Than Unaugmented Data

William C. Huang, Haokun Liu|arXiv (Cornell University)|Oct 9, 2020
Topic Modeling参考文献 16被引用 5
一句话总结

本研究评估了在SNLI数据中引入反事实样本增强后,是否能提升模型的泛化能力和鲁棒性,相较于未增强的数据。通过在增强版(CNLI)、未增强版SNLI以及仅种子样本的CNLI子集上微调RoBERTa模型,作者发现与相同规模的未增强数据相比,未观察到显著的泛化优势,且在某些情况下,增强反而损害了鲁棒性——尤其是在基于否定的挑战性样本上——表明当前通过众包方式生成的反事实增强对训练鲁棒的NLU模型无效。

ABSTRACT

A growing body of work shows that models exploit annotation artifacts to achieve state-of-the-art performance on standard crowdsourced benchmarks---datasets collected from crowdworkers to create an evaluation task---while still failing on out-of-domain examples for the same task. Recent work has explored the use of counterfactually-augmented data---data built by minimally editing a set of seed examples to yield counterfactual labels---to augment training data associated with these benchmarks and build more robust classifiers that generalize better. However, Khashabi et al. (2020) find that this type of augmentation yields little benefit on reading comprehension tasks when controlling for dataset size and cost of collection. We build upon this work by using English natural language inference data to test model generalization and robustness and find that models trained on a counterfactually-augmented SNLI dataset do not generalize better than unaugmented datasets of similar size and that counterfactual augmentation can hurt performance, yielding models that are less robust to challenge examples. Counterfactual augmentation of natural language understanding data through standard crowdsourcing techniques does not appear to be an effective way of collecting training data and further innovation is required to make this general line of work viable.

研究动机与目标

  • 探究反事实增强的SNLI数据是否相较于未增强数据能提升模型的泛化能力和鲁棒性。
  • 评估在控制数据集规模和标注成本的前提下,反事实增强在训练数据中的优势是否仍然成立。
  • 检验词汇多样性与数据增强在NLI模型性能提升中何者贡献更大。
  • 通过诊断挑战集评估反事实样本对模型鲁棒性的影响,尤其关注否定和词重叠启发式方法。
  • 确定当前众包协议生成的反事实数据收集是否能产生适用于鲁棒NLU模型训练的有效训练数据。

提出的方法

  • 在三个训练集上微调RoBERTa模型:(1) 完整的反事实增强版CNLI(8.3k个样本),(2) 未增强版SNLI的8.3k子样本,以及(3) 原始的1.7k个CNLI种子样本。
  • 在MNLI(跨域NLI基准)和两个针对特定启发式方法的诊断集(Naik et al., 2018;Wang et al., 2019a)上评估模型性能。
  • 使用标准NLI指标(蕴含、矛盾、中性准确率)衡量性能,并通过n-gram计数(n=1至4)分析词汇多样性。
  • 对比模型在否定挑战样本上的表现——在假设句后附加"and false is not true"——以测试其对否定启发式方法的敏感性。
  • 采用受控比较方法,将增强的影响与数据集规模分离,确保对增强价值的公平评估。
  • 分析相较于种子样本的性能提升,究竟是源于词汇多样性增加,还是源于反事实样本的引入。

实验结果

研究问题

  • RQ1在反事实增强的SNLI数据上进行训练,是否能实现相较于相同规模未增强SNLI数据的更好跨域泛化能力?
  • RQ2在包含反事实增强样本的情况下,模型在诊断挑战集上的鲁棒性是否得到提升,尤其是在否定和词重叠启发式方面?
  • RQ3性能提升在多大程度上源于词汇多样性增加,而非反事实样本带来的语义对比?
  • RQ4通过标准众包方式实现的反事实增强,能否产生比未增强数据训练出的模型具有更好泛化能力或更高鲁棒性的模型?
  • RQ5在当前的众包协议下,考虑到相近的标注成本,对数据进行反事实增强是否具有净收益?

主要发现

  • 在反事实增强版CNLI数据上训练的模型,在MNLI上的跨域泛化能力与在相同规模未增强SNLI子集上训练的模型相比,未表现出显著提升。
  • 在否定挑战集上的表现,CNLI训练的模型劣于在未增强SNLI子集或仅CNLI种子样本上训练的模型,表明其鲁棒性下降。
  • CNLI相较于CNLI种子集的性能提升主要源于词汇多样性增加,4-gram数量从约21.5k个增至42.5k个。
  • 尽管有最小编辑限制,CNLI中2-、3-和4-gram类型的数量仅相当于相同规模未增强SNLI集的约70%,表明单个样本的词汇多样性有限。
  • 作者未发现反事实增强能提升鲁棒性的证据,反而可能放大现有启发式,如否定词与矛盾预测之间的关联。
  • 鉴于众包工作者在目标编辑和新样本创建上花费的时间相近,当前方法在训练鲁棒模型方面相较于标准数据收集方式并无明显优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。