[论文解读] Denoising Neural Machine Translation Training with Trusted Data and Online Data Selection
该论文提出了一种用于神经机器翻译(NMT)的去噪训练框架,利用一个小规模可信平行语料库来衡量并逐步减少训练过程中的数据噪声。通过基于对比建模的在线数据选择方法,将一个噪声NMT模型与一个轻微去噪的模型进行比较,该方法在噪声网络爬取数据上显著提升了翻译质量,与基线模型相比,在专利测试集上实现了最高+10.4 BLEU的提升。
Measuring domain relevance of data and identifying or selecting well-fit domain data for machine translation (MT) is a well-studied topic, but denoising is not yet. Denoising is concerned with a different type of data quality and tries to reduce the negative impact of data noise on MT training, in particular, neural MT (NMT) training. This paper generalizes methods for measuring and selecting data for domain MT and applies them to denoising NMT training. The proposed approach uses trusted data and a denoising curriculum realized by online data selection. Intrinsic and extrinsic evaluations of the approach show its significant effectiveness for NMT to train on data with severe noise.
研究动机与目标
- 为解决神经机器翻译(NMT)中数据噪声这一尚未被充分探索的问题,该问题对NMT模型性能的损害比统计机器翻译(SMT)更为严重。
- 将原本专为领域相关性设计的成功领域数据选择技术,推广至去噪框架中,以应对NMT中的数据质量问题。
- 开发一种方法,在训练过程中动态测量噪声,利用小规模可信语料库作为参考,用于模型间的比较。
- 提升NMT在噪声数据(如网络爬取的Paracrawl数据)上的鲁棒性,此类数据中的噪声包括错位、部分翻译和流畅性问题等。
提出的方法
- 该方法将噪声定义为在相同数据上训练但初始化或数据过滤方式不同的噪声NMT模型与轻微去噪模型之间的行为差异。
- 使用一个小规模可信平行语料库(如WMT newstest)作为参考,训练一个去噪模型,然后利用该模型为每个训练句子对计算噪声得分。
- 噪声得分通过公式4计算,该公式比较了噪声模型和去噪模型在每个句子对上的交叉熵损失。
- 在线数据选择动态地根据噪声水平对训练批次进行排序,使模型能够随时间逐步在更清洁的数据上进行训练。
- 该方法使用序列到序列NMT模型进行噪声评分,而非传统语言模型,以更好地捕捉翻译特定的噪声。
- 通过使用与可信数据不同年份的开发集,避免了领域适应偏差,确保性能提升源于去噪,而非领域偏移。
实验结果
研究问题
- RQ1能否将领域数据选择中使用的数据质量度量方法,适配用于衡量和减少NMT训练中的数据噪声?
- RQ2与静态过滤或基于领域的选择相比,基于模型比较的动态在线数据选择在噪声数据上的NMT性能提升如何?
- RQ3使用小规模可信语料库作为噪声测量的参考,是否比仅依赖语言模型或启发式方法带来更有效的去噪效果?
- RQ4所提出的方法能否区分部分有用和有害的噪声样本,特别是在句子对仅部分为有效翻译时?
- RQ5所提出方法的性能提升是源于去噪,还是源于未预期的领域适应效应?
主要发现
- 所提出的基于NMT的噪声评分方法显著优于基于语言模型的选择方法,在对Top 20%选中数据进行微调时,专利测试集上实现了+10.4 BLEU的提升。
- 基于语言模型的方法未能实现去噪效果,因其与人工评分无相关性,且相比基线模型BLEU分数不升反降(31.8 vs. 31.6)。
- 在线去噪方法(P3)优于在选中数据上进行简单微调的方法(P2),表明动态、课程式训练比静态过滤更有效。
- 该方法在所有三个测试集上均提升了翻译准确率:n2014上+2.5 BLEU,d2015上+3.8 BLEU,patent上+10.4 BLEU,表明在不同领域中均具有一致的增益。
- 性能提升并非源于领域适应,因为通过使用不同年份的开发集验证,且发现基于领域的选择方法无法提升性能,从而得到确认。
- 结果表明,通过两个NMT模型之间的对比建模进行噪声测量,比依赖非专为翻译噪声设计的语言模型更为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。