Skip to main content
QUICK REVIEW

[论文解读] AR: Auto-Repair the Synthetic Data for Neural Machine Translation

Shanbo Cheng, Shaohui Kuang|arXiv (Cornell University)|Apr 5, 2020
Natural Language Processing Techniques参考文献 25被引用 4
一句话总结

本文提出 Auto-Repair (AR),一种基于 seq2seq 的框架,通过学习纠正通过回译或正向翻译生成的噪声翻译,从而提升神经机器翻译的合成平行数据质量。通过在单语数据上分别训练源到源和目标到目标的修复模型,AR 显著提升了翻译质量,在 WMT14 EN→DE 上实现最高 2.07 BLEU 的提升,在 IWSLT14 DE→EN 上实现最高 3.85 BLEU 的提升,均超过基线模型。

ABSTRACT

Compared with only using limited authentic parallel data as training corpus, many studies have proved that incorporating synthetic parallel data, which generated by back translation (BT) or forward translation (FT, or selftraining), into the NMT training process can significantly improve translation quality. However, as a well-known shortcoming, synthetic parallel data is noisy because they are generated by an imperfect NMT system. As a result, the improvements in translation quality bring by the synthetic parallel data are greatly diminished. In this paper, we propose a novel Auto- Repair (AR) framework to improve the quality of synthetic data. Our proposed AR model can learn the transformation from low quality (noisy) input sentence to high quality sentence based on large scale monolingual data with BT and FT techniques. The noise in synthetic parallel data will be sufficiently eliminated by the proposed AR model and then the repaired synthetic parallel data can help the NMT models to achieve larger improvements. Experimental results show that our approach can effective improve the quality of synthetic parallel data and the NMT model with the repaired synthetic data achieves consistent improvements on both WMT14 EN!DE and IWSLT14 DE!EN translation tasks.

研究动机与目标

  • 为解决神经机器翻译中合成平行数据持续存在的噪声问题,该问题限制了数据增强带来的性能提升。
  • 开发一种低成本、可扩展的方法,无需迭代微调或复杂的数据过滤,即可提升合成数据质量。
  • 实现直接利用单语数据和预训练的 NMT 模型对合成句子进行修复,从而提升下游翻译质量。

提出的方法

  • 在单语数据上分别训练 S2S 和 T2T 自动修复模型,将低质量的合成句子转换为更高质量的句子。
  • 使用预训练的 S2T 和 T2S 模型从单语源生成合成数据,然后应用 AR 模型对数据进行精炼。
  • 将原始数据与修复后的合成数据整合到最终的 NMT 训练过程中,结合真实数据、正向翻译数据、回译数据以及修复后的正向翻译/回译数据。
  • 在训练过程中采用学习率热身策略,结合 Adam 优化器和束搜索解码。
  • 使用开发集上的 BLEU、变化率和更好率指标评估修复质量,以衡量相比原始合成数据的改进程度。
  • 采用双阶段训练策略:首先在合成数据到真实句子对上训练 AR 模型,然后使用组合数据对主 NMT 模型进行微调。

实验结果

研究问题

  • RQ1基于 seq2seq 的自动修复模型能否有效提升通过回译或正向翻译生成的合成平行数据质量?
  • RQ2修复合成数据是否能在不同语言对和数据集上带来一致的 NMT 性能提升?
  • RQ3AR 模型实际修改了多少比例的合成数据?其中有多大比例的修复结果相比原始合成句子获得了更高的 BLEU 分数?
  • RQ4AR 框架能否在无需昂贵迭代微调的情况下高效应用于多种类型的合成数据?
  • RQ5将原始合成数据与修复后的合成数据结合使用,是否能带来比仅使用原始合成数据更好的 NMT 性能?

主要发现

  • 在 WMT14 EN→DE 翻译任务中,BASE + BTR-ADD + FTR-ADD 模型相比基线模型实现了 2.07 BLEU 的提升。
  • 在 IWSLT14 DE→EN 任务中,最佳 AR 模型相比基线模型提升了 3.85 BLEU,相比强基线(BT+FT)提升了 1.19 BLEU。
  • AR 模型在 EN→DE 和 DE→EN 两个任务上均使合成数据的 BLEU 分数提升超过 11 分,证明了其在质量增强方面的有效性。
  • 超过 76% 的合成句子被 AR 模型修改,表明其已充分学习到转换模式。
  • 超过 69% 的修复句子在句级别 BLEU 分数上优于其原始合成版本,证实了质量提升的一致性。
  • 在两个任务上,AR 框架平均相比基线模型提升 2.96 BLEU,相比强合成数据基线提升 0.97 BLEU。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。