[论文解读] Word-based Domain Adaptation for Neural Machine Translation
本文提出了一种用于电子商务场景下神经机器翻译(NMT)的词级领域自适应方法,通过使用领域特定语言模型与通用语言模型之间对数概率差异来分配词权重。在平滑处理和二值量化后,这些权重通过强调域外数据中类似域内词汇的词来提升训练效果,相较于基线方法,BLEU最高提升2.11分,TER最高提升1.59分,且在与微调结合时可获得进一步提升。
In this paper, we empirically investigate applying word-level weights to adapt neural machine translation to e-commerce domains, where small e-commerce datasets and large out-of-domain datasets are available. In order to mine in-domain like words in the out-of-domain datasets, we compute word weights by using a domain-specific and a non-domain-specific language model followed by smoothing and binary quantization. The baseline model is trained on mixed in-domain and out-of-domain datasets. Experimental results on English to Chinese e-commerce domain translation show that compared to continuing training without word weights, it improves MT quality by up to 2.11% BLEU absolute and 1.59% TER. We have also trained models using fine-tuning on the in-domain data. Pre-training a model with word weights improves fine-tuning up to 1.24% BLEU absolute and 1.64% TER, respectively.
研究动机与目标
- 通过利用少量域内数据和大量域外数据,解决低资源电子商务领域翻译问题。
- 通过词级加权而非句子级或块级加权来提升NMT性能。
- 在阈值处理前使用平滑技术减少词分值分配中的噪声。
- 证明使用词权重进行预训练可提升后续在域内数据上的微调性能。
提出的方法
- 通过领域特定语言模型(LM)与非领域特定LM的概率对数差异计算词分值。
- 通过邻近词的加权移动平均滤波器对词分值进行平滑处理,以减少分值噪声。
- 对平滑后的分值执行二值量化,生成0或1的词权重,以选择类似域内的词。
- 使用修改后的目标函数训练NMT模型,该函数通过词权重缩放交叉熵损失。
- 将加权词的模型作为预训练基础,再在域内数据上进行微调。
- 在英译中电子商务翻译基准上,使用BLEU和TER评估性能。
实验结果
研究问题
- RQ1基于语言模型概率差异的词级加权是否能提升低资源电子商务领域中的NMT性能?
- RQ2对词分值进行平滑处理如何影响从域外数据中选出的域内相似词的质量?
- RQ3使用词权重进行预训练是否能带来优于直接在域内数据上微调的性能提升?
- RQ4词级加权与句子级或块级加权在领域自适应中相比如何?
主要发现
- 在阈值处理前对词分值进行平滑处理显著提升了翻译质量,BLEU从21.38%提升至26.14%,TER从66.25%下降至60.34%。
- 在训练中持续使用词权重相比不使用词权重,BLEU绝对提升2.11分,TER绝对提升1.59分。
- 在词权重预训练后进行微调相比直接微调,BLEU绝对提升1.24分,TER绝对提升1.64分。
- 最长连续词(LCW)方法能有效保留有意义的域内片段(如“防/溢出/喷口/内”),同时过滤掉孤立的噪声词(如“空气”)。
- 该方法优于随机词掩码和未平滑的词加权,证实了在词分值分配中降噪的必要性。
- 该方法通过实现基于领域相似度的逐词选择,实现了实例加权的泛化,提升了低资源场景下的数据效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。