[论文解读] Self-supervised and Supervised Joint Training for Resource-rich Machine Translation
该论文提出 $F_{2}$-XEnDec,一种新颖的联合训练框架,通过交叉编码器-解码器机制融合单语(自监督)和并行(有监督)句子,以提升资源丰富型神经机器翻译性能。通过从混合输入生成 $F_2$-代后代,该方法在 WMT’14 英法翻译任务上达到最先进性能(46.19 BLEU),同时增强了对输入扰动(如代码切换)的鲁棒性。
Self-supervised pre-training of text representations has been successfully applied to low-resource Neural Machine Translation (NMT). However, it usually fails to achieve notable gains on resource-rich NMT. In this paper, we propose a joint training approach, $F_2$-XEnDec, to combine self-supervised and supervised learning to optimize NMT models. To exploit complementary self-supervised signals for supervised learning, NMT models are trained on examples that are interbred from monolingual and parallel sentences through a new process called crossover encoder-decoder. Experiments on two resource-rich translation benchmarks, WMT'14 English-German and WMT'14 English-French, demonstrate that our approach achieves substantial improvements over several strong baseline methods and obtains a new state of the art of 46.19 BLEU on English-French when incorporating back translation. Results also show that our approach is capable of improving model robustness to input perturbations such as code-switching noise which frequently appears on social media.
研究动机与目标
- 解决在标注数据丰富的资源丰富型机器翻译设置中,自监督预训练效果有限的问题。
- 克服联合训练中监督信号主导的问题,通常会压倒较弱的自监督信号。
- 开发一种统一的单阶段训练范式,有效利用未标注单语句和标注并行句的互补信号。
- 提升模型对输入扰动(如社交媒体中常见的代码切换噪声)的鲁棒性。
提出的方法
- 提出一种交叉编码器-解码器(XEnDec)机制,接收两个输入样本——单语句和并行句,并通过源句混洗与条件解码生成混合、混合型句对。
- 将 XEnDec 应用于生成 $F_1$ 和 $F_2$ 代:$F_1$-XEnDec 使用带噪声的单语句进行自监督学习,而 $F_2$-XEnDec 融合单语句与并行输入以实现联合训练。
- 在源空间中采用非线性混合策略,并强制模型从部分混合的源表示中重建完整的目标序列,以促进特征解耦与泛化。
- 采用多任务目标,结合有监督翻译损失与 $F_1$ 和 $F_2$ 代的自监督重建损失。
- 引入噪声函数 $n(\mathbf{y}^u)$ 以污染单语句,用于 $F_1$-XEnDec,实现在联合框架内的自监督预训练。
- 在 WMT’14 英德与英法基准上验证该方法,包括使用回译数据,采用单阶段训练循环,无需冻结预训练组件。
实验结果
研究问题
- RQ1当与有监督目标联合训练时,自监督学习信号是否能显著提升资源丰富型机器翻译的性能?
- RQ2如何在单阶段训练中有效融合自监督与有监督信号,以避免信号主导与灾难性遗忘?
- RQ3所提出的 $F_2$-XEnDec 框架是否能增强模型对输入扰动(如低资源或社交媒体环境中的代码切换)的鲁棒性?
- RQ4XEnDec 机制是否能通过受控的数据混合恢复或超越现有自监督与有监督训练目标?
- RQ5与传统的两阶段微调方法相比,$F_2$-XEnDec 的联合训练在性能与泛化能力方面表现如何?
主要发现
- 当结合回译时,$F_2$-XEnDec 方法在 WMT’14 英法翻译基准上达到新的最先进 BLEU 得分 46.19。
- 与基线 Transformer 相比,该方法在英德翻译上提升 2.13 BLEU 点,在英法翻译上提升 1.78 BLEU 点。
- 该方法对输入扰动(如代码切换噪声)表现出更优的鲁棒性,这是以往两阶段微调方法所不具备的能力。
- 消融研究证实,$F_2$-代生成与噪声函数 $n(\mathbf{y}^u)$ 均对性能至关重要,移除任一均导致性能下降。
- 与基于 Mixup 的数据混合相比,XEnDec 表现更优,表明在此情境下,具有结构解耦的非线性混合比线性插值更有效。
- 单阶段联合训练框架优于冻结或微调预训练表示的两阶段方法,表明端到端联合优化能更充分释放自监督信号的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。