[论文解读] Unsupervised Neural Machine Translation with SMT as Posterior Regularization
本文提出了一种新颖的无监督神经机器翻译(NMT)框架,将短语基于统计机器翻译(SMT)作为后验正则化,以去噪并指导NMT训练。通过在统一的EM框架中联合优化SMT与NMT,该方法减轻了由噪声回译导致的误差累积,在en-fr和en-de翻译任务上实现了最先进性能。
Without real bilingual corpus available, unsupervised Neural Machine Translation (NMT) typically requires pseudo parallel data generated with the back-translation method for the model training. However, due to weak supervision, the pseudo data inevitably contain noises and errors that will be accumulated and reinforced in the subsequent training process, leading to bad translation performance. To address this issue, we introduce phrase based Statistic Machine Translation (SMT) models which are robust to noisy data, as posterior regularizations to guide the training of unsupervised NMT models in the iterative back-translation process. Our method starts from SMT models built with pre-trained language models and word-level translation tables inferred from cross-lingual embeddings. Then SMT and NMT models are optimized jointly and boost each other incrementally in a unified EM framework. In this way, (1) the negative effect caused by errors in the iterative back-translation process can be alleviated timely by SMT filtering noises from its phrase tables; meanwhile, (2) NMT can compensate for the deficiency of fluency inherent in SMT. Experiments conducted on en-fr and en-de translation tasks show that our method outperforms the strong baseline and achieves new state-of-the-art unsupervised machine translation performance.
研究动机与目标
- 解决由于通过迭代回译生成的伪双语数据存在噪声,导致无监督NMT中误差累积的问题。
- 利用SMT对噪声数据的鲁棒性,通过短语表过滤掉不常见和错误的翻译模式。
- 通过在统一的EM框架中联合训练,实现SMT与NMT的相互改进,且无需修改模型架构。
- 通过结合NMT的流畅性与SMT基于模式的去噪能力,提升翻译流畅度与准确性。
- 在标准基准任务上实现无监督机器翻译的最先进性能。
提出的方法
- 使用预训练的多语言语言模型和从跨语言句子嵌入中提取的词级翻译表初始化SMT模型。
- 将SMT与NMT的联合训练表述为后验正则化问题,同时保留原始的NMT与SMT架构。
- 使用EM算法迭代优化两个模型:SMT通过过滤噪声翻译来优化伪双语数据,NMT则提升输出的流畅性。
- 将SMT短语表作为约束条件,用于正则化NMT解码,优先选择高频且可靠的翻译模式。
- 逐步改进两个模型:NMT生成更优质的伪数据供SMT使用,SMT则纠正NMT的错误输出。
- 维持统一的训练循环,其中SMT充当去噪过滤器,NMT增强流畅性,两个模型共同演化。
实验结果
研究问题
- RQ1SMT模型能否在迭代回译过程中有效减少无监督NMT中的噪声与误差传播?
- RQ2如何在不修改模型架构的前提下,联合优化SMT与NMT以提升彼此性能?
- RQ3通过SMT短语表进行后验正则化,是否能相比标准回译基线提升翻译质量?
- RQ4将SMT作为后验正则化器,能否缓解NMT中罕见或错误翻译模式的累积问题?
- RQ5联合EM框架在无监督设置下,能在多大程度上实现SMT与NMT的渐进式改进?
主要发现
- 所提方法在en-fr和en-de无监督机器翻译基准上均取得了新的最先进性能。
- 案例研究显示,SMT能有效纠正NMT的特定错误——例如将“malade”误译为“ill-fated”——通过过滤低频且错误的翻译模式。
- SMT模型从NMT生成的伪数据中受益,后续迭代中输出更加流畅,体现了双向改进。
- 该方法减少了由NMT错误生成导致的冗余或未对齐短语(如“plenty of”或“canopy-back business”)。
- 联合EM框架实现了渐进式优化:NMT提升流畅性,SMT增强模式可靠性,从而带来稳定性能提升。
- 该方法通过SMT对噪声数据的鲁棒性及短语表正则化,有效缓解了回译中的误差累积问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。