Skip to main content
QUICK REVIEW

[论文解读] AdMix: A Mixed Sample Data Augmentation Method for Neural Machine Translation

Chang Jin, Shigui Qiu|arXiv (Cornell University)|May 10, 2022
Natural Language Processing Techniques被引用 4
一句话总结

AdMix 提出了一种用于神经机器翻译的新型数据增强方法,通过使用 Beta 和 Dirichlet 分布对原始句子与离散噪声变体(通过词替换、删除或互换生成)进行软混合,从而提升模型性能。该方法在强基线 Transformer 模型上实现了 1.0–2.7 BLEU 点的性能提升,并增强了对输入扰动的鲁棒性。

ABSTRACT

In Neural Machine Translation (NMT), data augmentation methods such as back-translation have proven their effectiveness in improving translation performance. In this paper, we propose a novel data augmentation approach for NMT, which is independent of any additional training data. Our approach, AdMix, consists of two parts: 1) introduce faint discrete noise (word replacement, word dropping, word swapping) into the original sentence pairs to form augmented samples; 2) generate new synthetic training data by softly mixing the augmented samples with their original samples in training corpus. Experiments on three translation datasets of different scales show that AdMix achieves signifi cant improvements (1.0 to 2.7 BLEU points) over strong Transformer baseline. When combined with other data augmentation techniques (e.g., back-translation), our approach can obtain further improvements.

研究动机与目标

  • 为解决现有基于离散噪声的数据增强方法在神经机器翻译中多样性有限且语义不一致的问题。
  • 通过生成保持源句与目标句语义对应关系的合成训练样本,提升模型泛化能力与鲁棒性。
  • 开发一种不依赖额外单语数据或复杂训练过程的数据增强方法。
  • 探索 AdMix 与其他增强技术(如回译)之间的协同效应。

提出的方法

  • AdMix 在原始句子对中引入轻微的离散噪声(如词替换、删除、互换),以生成增强样本。
  • 通过从 Dirichlet(α, ..., α) 分布中采样,实现对增强样本与原始样本的软混合。
  • 利用 Beta(β, β) 分布,通过残差连接进一步将混合样本与原始样本融合。
  • 最终的合成样本通过两阶段凸组合生成,从而保持语义一致性。
  • 该方法在增强过程中旨在保持源句与目标句之间的对齐关系。
  • 超参数如噪声比例 γ 和混合强度 α、β 经调优以实现最佳性能。

实验结果

研究问题

  • RQ1在不依赖额外单语数据的前提下,离散噪声与软混合的结合是否能提升 NMT 性能?
  • RQ2与标准噪声或基线模型相比,AdMix 是否能增强模型对输入扰动的鲁棒性?
  • RQ3AdMix 在不同规模和语言对的多样化翻译任务中表现如何?
  • RQ4AdMix 是否能与回译等其他数据增强技术有效结合,从而带来进一步性能提升?

主要发现

  • 在 IWSLT14 De-En、LDC Zh-En 和 WMT14 En-De 翻译任务上,AdMix 相较于强基线 Transformer 模型实现了 1.0 至 2.7 BLEU 点的性能提升。
  • 在德语-英语验证集上,AdMix 在 0.1 噪声比例下达到 38.28 BLEU,优于所有基线模型(包括 SeqMix 和 Swap)。
  • 即使在较高噪声水平(最高达 0.4)下,AdMix 仍保持稳定性能,经三次操作后在噪声输入上的 BLEU 得分为 32.58。
  • 使用 AdMix 训练的模型表现出更优的鲁棒性:经过三次操作,BLEU 仅从 38.28 降至 32.58,而原始 Transformer 模型则从 35.82 降至 29.75。
  • 当与回译结合时,AdMix 相较于单独使用 AdMix 还能带来额外 0.36 BLEU 的性能提升,表明存在协同增益效应。
  • 无论在何种噪声水平或鲁棒性评估设置下,该方法均持续优于所有基线模型,证实了其有效性和稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。