[论文解读] Unsupervised Domain Adaptation for Neural Machine Translation with Domain-Aware Feature Embeddings
本文提出领域感知特征嵌入(DAFE),一种面向神经机器翻译的模型中心型无监督领域自适应方法,通过辅助语言建模任务学习领域特定表示。通过将隐藏状态解耦为领域感知与任务感知组件,DAFE 实现了无需领域内平行语料的可控领域自适应翻译,相较于基线模型最高可提升 5 BLEU 点,且与回译技术结合时可获得互补性增益。
The recent success of neural machine translation models relies on the availability of high quality, in-domain data. Domain adaptation is required when domain-specific data is scarce or nonexistent. Previous unsupervised domain adaptation strategies include training the model with in-domain copied monolingual or back-translated data. However, these methods use generic representations for text regardless of domain shift, which makes it infeasible for translation models to control outputs conditional on a specific domain. In this work, we propose an approach that adapts models with domain-aware feature embeddings, which are learned via an auxiliary language modeling task. Our approach allows the model to assign domain-specific representations to words and output sentences in the desired domain. Our empirical results demonstrate the effectiveness of the proposed strategy, achieving consistent improvements in multiple experimental settings. In addition, we show that combining our method with back translation can further improve the performance of the model.
研究动机与目标
- 解决在缺乏领域内平行语料的低资源或分布外设置下神经机器翻译性能不佳的挑战。
- 克服现有无监督领域自适应方法中通用表示的局限性,这些方法无法有效建模领域特异性语义。
- 通过学习解耦的领域感知表示,实现可控的、领域特定的翻译输出。
- 开发一种在低数据场景下依然有效的技术,并能与以数据为中心的技术(如回译)互补。
提出的方法
- DAFE 将模型解耦为共享基础网络和独立的领域感知与任务感知特征嵌入学习器,后者生成领域特定表示。
- 通过在单语数据上采用辅助语言建模目标学习领域感知特征嵌入,实现在无领域内平行语料的情况下进行领域特定表示学习。
- 最终层输出通过将基础网络表示与学习到的领域和任务嵌入进行逐元素相加生成。
- 该方法被集成到基于 Transformer 的神经机器翻译架构中,支持跨领域的共享基础参数端到端训练。
- 通过推理时对解码器施加目标领域嵌入,实现领域控制,从而实现针对性的输出生成。
- 该方法在低资源和多领域设置下进行了评估,并通过消融实验验证了各组件的贡献。
实验结果
研究问题
- RQ1通过学习领域感知表示而非通用表示,能否改善神经机器翻译中的无监督领域自适应?
- RQ2与标准回译或数据复制方法相比,所提出的 DAFE 方法是否能实现更好的输出领域控制?
- RQ3在低资源设置下,当回译因合成数据质量差而性能下降时,DAFE 表现如何?
- RQ4DAFE 是否与以数据为中心的方法(如回译)具有互补性,能否被有效结合?
- RQ5当对正确领域嵌入进行条件控制时,模型能否生成领域特定的词汇和表达?
主要发现
- 在多个领域对(包括德语-英语、捷克语-英语及多语言设置)中,DAFE 相较于未自适应的基线模型,最高可实现 5 BLEU 点的性能提升。
- 在 WMT'14 德语-英语医学翻译任务中,DAFE 将 BLEU 从基线的 24.61 提升至 26.75,与回译结合后进一步提升至 28.09 BLEU。
- 在低资源设置下,DAFE 显著优于回译,后者可能因低质量合成数据而性能下降。
- 输入错误的领域嵌入会导致性能下降,证实了领域控制的有效性与可控性。
- 模型能生成领域特异性术语——例如在医学嵌入下生成 'EMEA' 和 'intramuscular',在 IT 嵌入下生成 'bug' 和 'developers',表明实现了成功的领域控制。
- 将 DAFE 与回译结合可获得最佳性能,在 MED 任务上达到 38.79 BLEU,表明两种方法具有正交性与互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。