[论文解读] Building a Multi-domain Neural Machine Translation Model using Knowledge Distillation
本文提出了一种基于知识蒸馏的框架,通过从多个领域专用的教师模型蒸馏专业知识,训练单一的多领域神经机器翻译(NMT)模型,在不增加推理成本的前提下,相较于标准微调方法,BLEU分数最高提升2.0分。该方法使用预训练的通用学生模型,并结合动态数据选择,在2至4个领域间高效地迁移知识。
Lack of specialized data makes building a multi-domain neural machine translation tool challenging. Although emerging literature dealing with low resource languages starts to show promising results, most state-of-the-art models used millions of sentences. Today, the majority of multi-domain adaptation techniques are based on complex and sophisticated architectures that are not adapted for real-world applications. So far, no scalable method is performing better than the simple yet effective mixed-finetuning, i.e finetuning a generic model with a mix of all specialized data and generic data. In this paper, we propose a new training pipeline where knowledge distillation and multiple specialized teachers allow us to efficiently finetune a model without adding new costs at inference time. Our experiments demonstrated that our training pipeline allows improving the performance of multi-domain translation over finetuning in configurations with 2, 3, and 4 domains by up to 2 points in BLEU.
研究动机与目标
- 解决在实际应用中部署多个单领域NMT模型所面临的可扩展性与效率挑战。
- 克服现有多领域适应技术的局限性,这些技术依赖于模型集成、重排序或输入分类,导致复杂度与成本增加。
- 开发一种可扩展且推理成本低的方法,将多个专用领域模型的专业知识整合到单一统一的学生模型中。
- 证明知识蒸馏能够超越标准的混合微调方法,同时保持通用模型的简洁性与高效性。
- 将该方法推广至2、3和4个领域,展示在医疗、法律、软件和宗教文本等多样化领域中的一致性能提升。
提出的方法
- 使用最先进的单领域适应技术,在领域特定数据上训练多个专用教师模型。
- 通过知识蒸馏,将这些教师模型的知识迁移至一个单一的、预训练的通用学生模型。
- 在教师模型微调过程中应用动态数据选择,以在蒸馏前提升特定领域的性能。
- 使用加权损失函数,结合负对数似然与Kullback-Leibler散度,通过硬标签(来自教师)和软标签(logits)联合训练学生模型。
- 通过超参数λ优化蒸馏过程,以平衡交叉熵损失与KL散度损失。
- 保持原始学生模型架构不变,不进行结构修改或参数增加,确保推理效率。

实验结果
研究问题
- RQ1知识蒸馏能否有效将多个领域专用教师模型的专业知识整合到单一多领域学生模型中?
- RQ2所提出的蒸馏框架在多个领域中是否优于标准混合微调方法的BLEU分数?
- RQ3标签平滑对多领域NMT中知识蒸馏性能有何影响?
- RQ4该蒸馏方法在2、3和4个领域中是否具备可扩展性与有效性,且在不同数据复杂度下表现稳定?
- RQ5该方法能否在提升翻译质量的同时,保持低推理成本,相较于模型集成或先前的分类方法?
主要发现
- 所提出的知识蒸馏方法在2名教师配置下,相较于混合微调,BLEU分数最高提升2.0分;在4名教师设置中,提升达1.55分。
- 硬标签蒸馏(HS)策略优于软标签蒸馏(SS),ΔHS在2、3和4个领域中的平均值分别为2.0、1.1和1.55 BLEU。
- 在医疗和宗教数据集上(通用模型表现较差),蒸馏方法展现出显著提升,相较于基线模型最高提升达20 BLEU分。
- 该方法优于模型集成和先前的分类技术,尤其在低资源或分布外设置下表现更优,同时保持了低推理成本。
- 标签平滑对蒸馏性能有可测量的负面影响,硬标签蒸馏结果优于软标签蒸馏。
- 该方法在多样化领域中具有良好的泛化能力,涵盖法律(高基线)、医疗(显著提升)、软件(短句)和宗教(历史语言)等类型。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。