Skip to main content
QUICK REVIEW

[论文解读] Multilingual Multi-Domain Adaptation Approaches for Neural Machine Translation

Chenhui Chu, Raj Dabre|arXiv (Cornell University)|Jun 19, 2019
Natural Language Processing Techniques参考文献 31被引用 8
一句话总结

本论文为基于Transformer的神经机器翻译(NMT)模型提出了两种新颖的领域自适应方法——领域专业化和领域极端化,显式建模领域特定表示或预测器偏差。通过将这些方法与混合微调相结合,并引入多语言数据,该方法在低资源领域内翻译和资源丰富领域外翻译任务中均取得了最先进性能,显著提升表现。

ABSTRACT

In this paper, we propose two novel methods for domain adaptation for the attention-only neural machine translation (NMT) model, i.e., the Transformer. Our methods focus on training a single translation model for multiple domains by either learning domain specialized hidden state representations or predictor biases for each domain. We combine our methods with a previously proposed black-box method called mixed fine tuning, which is known to be highly effective for domain adaptation. In addition, we incorporate multilingualism into the domain adaptation framework. Experiments show that multilingual multi-domain adaptation can significantly improve both resource-poor in-domain and resource-rich out-of-domain translations, and the combination of our methods with mixed fine tuning achieves the best performance.

研究动机与目标

  • 通过显式建模领域特定特征而非依赖黑箱方法,解决神经机器翻译(NMT)中低资源领域翻译的挑战。
  • 克服现有黑箱领域自适应技术的局限性,这些技术使用人工标记或缺乏架构修改,可能掩盖模型的学习动态。
  • 提出一个统一框架,结合多语言与多领域自适应,以提升在多样化语言对与领域中的翻译性能。
  • 研究在仅使用注意力机制的Transformer架构背景下,显式领域建模的有效性,该架构在先前研究中已优于RNN模型。
  • 证明将所提方法与混合微调结合,可在领域内与领域外翻译设置中均取得更优结果。

提出的方法

  • 提出领域专业化:在Softmax前修改解码器状态,通过复制隐藏状态并使用下投影减少参数增长,实现领域特定与共享特征的学习。
  • 引入领域极端化:为每个领域学习领域特定的偏差向量,将其添加到Softmax前的最终层logits中,使模型能够按领域自适应预测。
  • 将两种方法与混合微调(MFT)结合,即在微调过程中同时使用领域内与领域外数据,以防止过拟合并实现平滑的领域过渡。
  • 通过在多个语言对与领域上联合训练单一模型,将框架扩展至多语言设置,同时利用跨语言迁移与多领域数据。
  • 使用带有可学习权重矩阵 $ W_d \in \mathbb{R}^{|s_i| \times |s_i|/3} $ 的下投影,减少状态复制带来的参数增长,保持模型效率。
  • 避免预先添加人工领域标记;相反,依赖修改后的解码器架构,通过表示或偏差自适应隐式学习领域身份。

实验结果

研究问题

  • RQ1在解码器中显式建模领域特定表示是否能相比黑箱方法提升低资源领域的NMT性能?
  • RQ2学习领域特定偏差向量(即领域极端化)是否能带来比标准微调或多领域训练更好的泛化能力与性能?
  • RQ3结合多语言与多领域数据对翻译性能有何影响,特别是在资源匮乏领域与领域外语言对中?
  • RQ4所提方法是否能与混合微调有效结合,进一步提升领域内与领域外翻译的性能?
  • RQ5多语言性整合是否能增强领域自适应NMT模型的鲁棒性与泛化能力,尤其在领域与语言资源均有限的情况下?

主要发现

  • 领域专业化与混合微调结合(domspec+MFT)在IWSLT-JE领域内翻译任务中取得了27.48的最高BLEU-4分数,显著优于基线黑箱方法(p < 0.05)。
  • 在多语言多领域自适应中,domextr+MFT方法在KFTT-JE上取得了26.50的总体最佳BLEU-4分数,显著优于基线MFT与其他方法。
  • 当与MFT结合时,所提方法在资源丰富但领域外的翻译方向(如IWSLT-JE与IWSLT-CE)上性能最高提升1.5 BLEU点,证明其泛化能力不仅限于低资源领域。
  • 在多语言设置中,将领域专业化与极端化结合MFT(domspecextr+MFT)在IWSLT-JE上取得17.49 BLEU-4,优于所有黑箱方法与独立MFT。
  • 在多语言多领域自适应中,最佳整体性能由domextr+MFT实现(KFTT-JE上为26.50 BLEU-4),以‡标记,表明其在所有数据设置中均为最优得分。
  • 仅在领域内数据上微调导致领域外性能极差(如IWSLT-JE上仅为6.13 BLEU),证实使用领域外数据的必要性,以及所提方法在提升迁移能力方面的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。