Skip to main content
QUICK REVIEW

[论文解读] Improving Domain Adaptation Translation with Domain Invariant and Specific Information

Shuhao Gu, Yang Feng|arXiv (Cornell University)|Apr 8, 2019
Natural Language Processing Techniques参考文献 30被引用 8
一句话总结

该论文提出了一种新颖的神经机器翻译框架,通过为每个领域使用共享(通用)和私有编码器/解码器,显式分离领域不变特征与领域特定特征,并借助领域判别器进行对抗性训练。该方法在多个数据集和模型上显著提升了领域内翻译性能,优于包括微调和采样方法在内的强基线模型,同时保持或略微提升了领域外翻译性能。

ABSTRACT

In domain adaptation for neural machine translation, translation performance can benefit from separating features into domain-specific features and common features. In this paper, we propose a method to explicitly model the two kinds of information in the encoder-decoder framework so as to exploit out-of-domain data in in-domain training. In our method, we maintain a private encoder and a private decoder for each domain which are used to model domain-specific information. In the meantime, we introduce a common encoder and a common decoder shared by all the domains which can only have domain-independent information flow through. Besides, we add a discriminator to the shared encoder and employ adversarial training for the whole model to reinforce the performance of information separation and machine translation simultaneously. Experiment results show that our method can outperform competitive baselines greatly on multiple data sets.

研究动机与目标

  • 使用丰富的领域外平行数据,在低资源领域内神经机器翻译设置下提升翻译性能。
  • 解决直接将领域外数据与领域内数据结合时导致的过拟合风险。
  • 在翻译框架中显式建模领域不变知识(跨领域共享)和领域特定知识(每个领域独有)。
  • 通过对抗性训练增强领域不变与领域特定表示之间的特征解耦。
  • 证明私有解码器在提升领域内翻译性能方面的作用,而不仅限于私有编码器。

提出的方法

  • 该模型使用共享编码器和解码器提取所有领域中的领域不变特征,同时每个领域拥有其自身的私有编码器和解码器以建模领域特定特征。
  • 共享编码器通过对抗学习与领域判别器联合训练,以确保其仅捕获领域不变信息。
  • 每个领域的最终翻译输出由该领域的共享解码器输出与私有解码器输出组合生成。
  • 在共享编码器与判别器之间应用对抗性训练,以强制学习领域不变表示。
  • 该架构在基于RNN(RNNSearch)和基于Transformer的模型上均进行了评估,证明其在不同神经机器翻译框架中的泛化能力。
  • 通过t-SNE可视化和隐藏状态坐标分析,对领域不变与领域特定特征的解耦进行实证验证。

实验结果

研究问题

  • RQ1显式分离领域不变与领域特定特征是否能提升领域内神经机器翻译性能?
  • RQ2在仅使用私有编码器的基础上,引入私有解码器是否能带来比仅使用私有编码器的模型更好的性能?
  • RQ3在共享编码器上应用对抗性训练是否能有效强制学习领域不变表示?
  • RQ4与微调和数据采样基线相比,该方法在领域内和领域外翻译性能上的表现如何?
  • RQ5模型特征空间的解耦程度在多大程度上与翻译质量的提升相关?

主要发现

  • 所提方法在领域内翻译任务中取得显著性能提升,在英文到中文和英文到德文的翻译任务中,均优于包括微调和采样方法在内的强基线模型。
  • 在使用Transformer模型的英文到中文翻译任务中,该方法在测试集上达到37.26的BLEU分数,超过微调基线(34.03)和采样方法(33.68)。
  • 不使用领域判别器的模型(’-DCN’)表现出较差的特征解耦,t-SNE可视化显示不同领域的隐藏状态显著重叠,表明领域信息混合严重。
  • 在完整模型下,领域内与领域外隐藏状态坐标的平均距离降低至21.3,表明领域分离更优,且领域不变表示学习有效。
  • 该方法同时保持或略微提升领域外翻译性能,避免了微调方法中常见的灾难性遗忘现象,在NIST测试集上的BLEU分数为22.61,而微调方法仅为13.18。
  • 消融实验确认,私有解码器与领域判别器均对性能提升有显著贡献,验证了设计选择的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。