Skip to main content
QUICK REVIEW

[论文解读] LINDA: Unsupervised Learning to Interpolate in Natural Language Processing

Yekyung Kim, Seohyeong Jeong|arXiv (Cornell University)|Dec 28, 2021
Natural Language Processing Techniques被引用 4
一句话总结

LINDA 提出了一种无监督的神经方法,用于在不依赖启发式规则或人工资源的情况下,对自然语言句子进行插值。通过训练一个条件语言模型,基于混合比例生成插值文本,LINDA 实现了有效的基于 mixup 的数据增强,在域内、域外以及低资源设置下的文本分类任务中显著提升了模型的泛化能力。

ABSTRACT

Despite the success of mixup in data augmentation, its applicability to natural language processing (NLP) tasks has been limited due to the discrete and variable-length nature of natural languages. Recent studies have thus relied on domain-specific heuristics and manually crafted resources, such as dictionaries, in order to apply mixup in NLP. In this paper, we instead propose an unsupervised learning approach to text interpolation for the purpose of data augmentation, to which we refer as "Learning to INterpolate for Data Augmentation" (LINDA), that does not require any heuristics nor manually crafted resources but learns to interpolate between any pair of natural language sentences over a natural language manifold. After empirically demonstrating the LINDA's interpolation capability, we show that LINDA indeed allows us to seamlessly apply mixup in NLP and leads to better generalization in text classification both in-domain and out-of-domain.

研究动机与目标

  • 为解决由于文本具有离散性和可变长度特性,导致在 NLP 中应用 mixup 的挑战。
  • 消除对领域特定启发式规则或人工整理的资源(如词典)在文本插值中的依赖。
  • 学习一种神经插值算子,使其能够在自然语言流形上生成语义连贯的插值句子。
  • 评估所学习的插值方法是否能在文本分类任务中通过 mixup 实现有效的数据增强。

提出的方法

  • 将文本插值定义为:基于两个输入句子和一个混合比例 α ∈ [0,1],从条件语言模型中采样。
  • 训练一个序列到序列模型(微调后的 BART)生成插值文本,使得两个输入句子在生成过程中均具有较高概率,且其相对可能性由 α 调节。
  • 使用对比学习目标,确保插值输出在潜在空间中同时接近两个输入,同时保持多样性。
  • 将学习到的插值方法作为 mixup 训练中的即插即用替代方案,通过 f_int^x 和 f_int^y 生成混合输入和软标签。
  • 通过交叉熵损失与对比损失的组合优化模型,以保持对两个源句子的语义保真度。
  • 在中等规模的 Wikipedia 语料库上微调模型,以学习在多样化句子对上的插值模式。

实验结果

研究问题

  • RQ1神经网络能否以一种语义连贯且受混合比例控制的方式,对任意自然语言句子对进行插值?
  • RQ2通过 LINDA 实现的无监督插值,是否能在接入 mixup 时实现有效的 NLP 数据增强?
  • RQ3在域内与域外泛化方面,LINDA 与启发式方法及基于模型的数据增强方法相比表现如何?
  • RQ4在标注数据稀缺的低资源设置下,LINDA 是否能提升模型性能?
  • RQ5插值行为是否随混合比例 α 呈单调且可预测的变化?

主要发现

  • LINDA 在多样化输入对上生成了语义连贯的插值句子,定性分析确认了混合比例对插值过程的可控性。
  • 自动评估指标显示,混合比例 α 与源句子相似度之间存在单调关系,证实了可控性。
  • 在低资源设置下(每类 5 或 10 个样本),LINDA 在除 TREC-fine(5-shot)外的所有数据集上均优于 EDA、SSMBA 和 mixup,其性能在标准差范围内。
  • 在全资源设置下,LINDA 在七项数据集中的四项达到最高准确率,其余表现具有竞争力,且始终优于未增强的基线模型。
  • 在 NLI 任务(RTE、QNLI、MNLI)中,LINDA 分别将准确率提升 5.4%(RTE)、0.7%(QNLI)和 0.5%(MNLI),而其他方法则导致性能下降。
  • 在域外泛化方面,LINDA 在所有领域(Amazon、Yelp、Movies)均表现提升,且始终超过原始基线,而 EDA 和 mixup 则未见性能改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。