Skip to main content
QUICK REVIEW

[论文解读] AdvAug: Robust Adversarial Augmentation for Neural Machine Translation

Yong Cheng, Lu Jiang|arXiv (Cornell University)|Jun 21, 2020
Natural Language Processing Techniques参考文献 27被引用 6
一句话总结

该论文提出了一种名为AdvAug的新颖对抗性数据增强方法,用于神经机器翻译(NMT),通过从以训练样本为中心的平滑插值嵌入空间中采样虚拟对抗性句子,提升模型的鲁棒性与性能。通过在这些虚拟嵌入上进行训练而非原始数据,AdvAug在Transformer模型上实现了最高达4.9 BLEU的性能提升,优于先前方法,且无需额外的单语语料。

ABSTRACT

In this paper, we propose a new adversarial augmentation method for Neural Machine Translation (NMT). The main idea is to minimize the vicinal risk over virtual sentences sampled from two vicinity distributions, of which the crucial one is a novel vicinity distribution for adversarial sentences that describes a smooth interpolated embedding space centered around observed training sentence pairs. We then discuss our approach, AdvAug, to train NMT models using the embeddings of virtual sentences in sequence-to-sequence learning. Experiments on Chinese-English, English-French, and English-German translation benchmarks show that AdvAug achieves significant improvements over the Transformer (up to 4.9 BLEU points), and substantially outperforms other data augmentation techniques (e.g. back-translation) without using extra corpora.

研究动机与目标

  • 为解决NMT模型在轻微输入扰动(如同义词替换)下的不稳定性问题,此类扰动会改变翻译输出。
  • 通过增加训练数据多样性来提升泛化能力,且不依赖外部单语语料库。
  • 开发一种更有效的对抗性增强策略,在保持语义有效性的同时增强模型鲁棒性。
  • 设计一种序列到序列的训练方法,利用嵌入空间中一种新颖的邻域分布生成的虚拟句子。

提出的方法

  • 提出一种新的邻域分布,将对抗性样本建模为围绕观测到的训练句子对的嵌入空间中的平滑插值。
  • 通过在源句和目标句中进行离散词替换生成对抗性句子,然后利用这些句子定义用于插值的邻域分布。
  • 通过使用温度参数α对原始句子对与对抗性句子对的嵌入进行线性插值,采样虚拟句子。
  • 使用包含干净样本和来自两个邻域分布(原始与对抗性)的虚拟样本的联合损失函数来训练NMT模型。
  • 采用小批量训练算法,在序列到序列框架中联合优化标准句子表示与虚拟句子表示。
  • 采用类似Mixup的插值策略,但将其应用于嵌入空间中的对抗性样本,确保语义一致性并实现更平滑的优化。

实验结果

研究问题

  • RQ1在嵌入空间中引入一种新型邻域分布,是否能提升NMT模型对微小输入扰动的鲁棒性?
  • RQ2通过插值方法采样虚拟对抗性句子,是否比直接使用原始对抗性样本进行数据增强能带来更好的泛化效果?
  • RQ3该方法是否能在不使用额外单语语料库的前提下,超越最先进的数据增强技术(如回译)?
  • RQ4与Mixup相比,该方法在训练稳定性与收敛速度方面表现如何?
  • RQ5对抗性邻域分布与干净数据邻域分布在整体性能提升中的贡献分别是什么?

主要发现

  • AdvAug在中英翻译任务上相较标准Transformer模型最高实现4.9 BLEU的性能提升,显著优于先前的最先进方法。
  • 在IWSLT英法和WMT英德基准测试中,AdvAug在对抗学习任务上相较之前SOTA方法最高提升3.3 BLEU分数。
  • 使用AdvAug训练的模型对噪声输入表现出更优的鲁棒性,在所有噪声水平下,即使在同义词替换扰动下也能保持高性能。
  • 使用AdvAug的损失函数进行训练可有效抵抗过拟合:即使在10万次迭代后BLEU分数仍保持稳定或继续提升,而基线模型在约2万次迭代后即出现过拟合。
  • 消融实验证实,对抗性邻域分布对性能提升的贡献大于干净数据邻域分布,尽管两者均有益处。
  • 即使不依赖额外单语语料库,AdvAug仍超越广泛使用的回译方法,证明其作为独立增强技术的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。