[论文解读] Bi-Directional Neural Machine Translation with Synthetic Parallel Data
本文提出一种双向神经机器翻译模型,通过使用从单语语料库生成的合成平行数据,联合训练源到目标和目标到源的翻译任务。通过训练单一模型实现双向翻译,并迭代地使用反向翻译的单语句子扩充训练数据,该方法在低资源和跨领域设置下提升了翻译质量,同时相比单向模型显著降低了训练和部署成本。
Despite impressive progress in high-resource settings, Neural Machine Translation (NMT) still struggles in low-resource and out-of-domain scenarios, often failing to match the quality of phrase-based translation. We propose a novel technique that combines back-translation and multilingual NMT to improve performance in these difficult cases. Our technique trains a single model for both directions of a language pair, allowing us to back-translate source or target monolingual data without requiring an auxiliary model. We then continue training on the augmented parallel data, enabling a cycle of improvement for a single model that can incorporate any source, target, or parallel data to improve both translation directions. As a byproduct, these models can reduce training and deployment costs significantly compared to uni-directional models. Extensive experiments show that our technique outperforms standard back-translation in low-resource scenarios, improves quality on cross-domain tasks, and effectively reduces costs across the board.
研究动机与目标
- 解决在平行数据稀缺的低资源和跨领域翻译场景中NMT性能不足的问题。
- 克服标准NMT模型在不修改网络结构的前提下难以利用单语数据的局限性。
- 通过在单一模型中整合双向翻译任务,降低训练和部署成本。
- 通过使用来自源语和目标语单语语料库的合成数据进行迭代反向翻译,提升翻译质量。
- 建立选择单语数据与合成数据组合的最佳实践,以最大化性能提升。
提出的方法
- 在包含原始和交换源-目标句子对的平衡数据集上训练单一多语言NMT模型,使用语言特定标记(如$<$2en$>$)指示翻译方向。
- 使用训练好的双向模型将单语源语和目标语数据翻译为双向的合成平行句子。
- 将原始平行训练数据与合成句子对结合,并继续训练同一模型,形成持续改进的循环。
- 在源语和目标语之间共享词嵌入,并使用共享的字节对编码(BPE)子词分词方法,以减少词汇量和模型复杂度。
- 通过交叉熵差异选择高质量单语数据,识别与领域内数据相似但与通用领域单语语料库不同的句子。
- 通过确保真实单语数据在合成数据生成过程中始终出现在目标侧,避免模型性能退化,从而无需冻结解码器参数。
实验结果
研究问题
- RQ1单一双向NMT模型能否有效利用来自源语和目标语的单语数据,从而提升翻译质量?
- RQ2在低资源设置下,使用合成数据联合训练双向任务是否优于使用独立反向模型的标准反向翻译方法?
- RQ3与单向模型相比,该方法在多大程度上降低了训练和部署成本?
- RQ4该方法在跨领域翻译任务(如现代英语到圣经希伯来语)中的有效性如何?
- RQ5选择单语数据以最大化合成数据增强收益的最优策略是什么?
主要发现
- 尽管基线模型性能极弱,但在经过增强数据微调后,该方法在圣经翻译任务上的BLEU分数相对提升了70%至130%。
- 在低资源场景下,该模型优于标准反向翻译方法,且无需辅助模型即可实现稳定性能提升。
- 在跨领域任务中,如将现代英语翻译为圣经希伯来语(OOV率超过30%),翻译质量显著提升。
- 通过将双向翻译任务整合到单一模型中,该方法大幅降低了训练和部署成本。
- 使用交叉熵差异进行单语数据选择,有助于识别高质量数据,从而生成更优的合成数据并提升模型性能。
- 该方法在无需参数冻结或架构修改的情况下,有效利用了源语和目标语的单语数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。