Skip to main content
QUICK REVIEW

[论文解读] An Empirical Survey of Data Augmentation for Limited Data Learning in NLP

Jiaao Chen, Derek Tam|arXiv (Cornell University)|Jun 14, 2021
Topic Modeling参考文献 67被引用 21
一句话总结

本文对低资源设置下自然语言处理(NLP)的数据增强技术进行了全面的实证调查,评估了在11个数据集上进行的词粒度、句子粒度、对抗性以及隐空间方法。研究发现,在监督学习中词粒度增强表现最佳,句子粒度增强在半监督设置中表现更优,而某些方法尽管在数据效率上有所提升,却可能降低性能。

ABSTRACT

NLP has achieved great progress in the past decade through the use of neural models and large labeled datasets. The dependence on abundant data prevents NLP models from being applied to low-resource settings or novel tasks where significant time, money, or expertise is required to label massive amounts of textual data. Recently, data augmentation methods have been explored as a means of improving data efficiency in NLP. To date, there has been no systematic empirical overview of data augmentation for NLP in the limited labeled data setting, making it difficult to understand which methods work in which settings. In this paper, we provide an empirical survey of recent progress on data augmentation for NLP in the limited labeled data setting, summarizing the landscape of methods (including token-level augmentations, sentence-level augmentations, adversarial augmentations, and hidden-space augmentations) and carrying out experiments on 11 datasets covering topics/news classification, inference tasks, paraphrasing tasks, and single-sentence tasks. Based on the results, we draw several conclusions to help practitioners choose appropriate augmentations in different settings and discuss the current challenges and future directions for limited data learning in NLP.

研究动机与目标

  • 系统评估并分类近期在低资源设置下用于NLP的数据增强方法。
  • 在多种NLP任务中比较词粒度、句子粒度、对抗性及隐空间增强方法的有效性。
  • 为实践者提供基于任务类型和数据可用性的数据增强方法选择实证指导。
  • 识别即使在半监督学习中也会损害性能的失败案例。
  • 指出数据高效NLP中的开放挑战与未来研究方向。

提出的方法

  • 本研究在四类方法中评估了11种数据增强技术:同义词替换、基于语言模型的词替换、随机插入/删除/交换、句子粒度方法、对抗性扰动以及基于截断的方法。
  • 实验在11个基准数据集上进行,涵盖文本分类、自然语言蕴含、释义匹配和单句任务。
  • 在每个类别仅提供100个标注样本的条件下,评估了监督学习与半监督学习设置,并使用GLUE及其他标准基准。
  • 通过准确率和F1分数衡量性能,结果基于三个随机种子取平均,并报告95%置信区间。
  • 通过20 Newsgroups和RTE数据集中25个样本的案例研究,分析标签保持性,评估增强是否改变了原始标签。
  • 通过受控消融实验与定性分析,评估增强对模型泛化能力与鲁棒性的影响。

实验结果

研究问题

  • RQ1在有限标注数据条件下,哪种数据增强方法在不同NLP任务中表现最佳?
  • RQ2不同层次的增强(词粒度 vs. 句子粒度)在监督学习与半监督学习中如何影响模型性能?
  • RQ3数据增强方法在转换过程中在多大程度上保持了原始标签?标签翻转如何影响性能?
  • RQ4在哪些场景下,数据增强技术会降低而非提升模型性能?
  • RQ5当前数据增强方法在低资源NLP中的关键失败模式与局限性是什么?

主要发现

  • 在有限标注数据的监督学习设置中,词粒度增强方法(如同义词替换和基于语言模型的词替换)始终优于其他方法。
  • 句子粒度增强方法(如随机插入与删除)在半监督学习中表现最佳,尤其在RTE和文本分类任务中。
  • 对抗性与隐空间增强方法(如对抗性扰动和基于截断的方法)在低数据环境下常表现欠佳或导致性能下降。
  • 在RTE数据集中,基于语言模型的增强在24%的案例中导致标签翻转,尽管预测置信度很高,但性能仍出现显著下降。
  • 基于截断的增强在96%的案例中保持了原始标签,并在RTE任务上取得了最佳性能,表明标签保持性对成功至关重要。
  • 令人意外的是,某些增强方法(包括基于语言模型和对抗性方法)即使在半监督设置中也降低了性能,凸显了分布偏移的风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。