[论文解读] Finding Sparse Structures for Domain Specific Neural Machine Translation
本文提出 Prune-Tune,一种用于神经机器翻译(NMT)的参数高效领域自适应方法,通过渐进剪枝从预训练的一般领域模型中提取稀疏、领域特定的子网络。通过冻结剪枝后的子网络并仅微调剩余参数,Prune-Tune 有效缓解了灾难性遗忘和过拟合问题,在单领域与多领域设置下均实现了当前最优性能,且未损害一般领域性能。
Neural machine translation often adopts the fine-tuning approach to adapt to specific domains. However, nonrestricted fine-tuning can easily degrade on the general domain and over-fit to the target domain. To mitigate the issue, we propose Prune-Tune, a novel domain adaptation method via gradual pruning. It learns tiny domain-specific sub-networks during fine-tuning on new domains. Prune-Tune alleviates the over-fitting and the degradation problem without model modification. Furthermore, Prune-Tune is able to sequentially learn a single network with multiple disjoint domain-specific sub-networks for multiple domains. Empirical experiment results show that Prune-Tune outperforms several strong competitors in the target domain test set without sacrificing the quality on the general domain in both single and multi-domain settings. The source code and data are available at https://github.com/ohlionel/Prune-Tune.
研究动机与目标
- 解决神经机器翻译(NMT)在领域自适应过程中出现的灾难性遗忘和过拟合问题。
- 开发一种参数高效的方法,在保留一般领域知识的同时适应特定领域。
- 通过迭代剪枝与微调,使单一模型能够支持多个互不重叠的领域。
- 探究是否可以自动发现并利用稀疏子网络实现领域特定的自适应。
- 提供一种可扩展、与模型无关的替代方案,以替代手工设计的适配器或正则化技术。
提出的方法
- 对预训练的一般领域 NMT 模型应用渐进剪枝,以识别保留一般知识的稀疏且高性能的子网络。
- 将剪枝后的子网络冻结,以在后续微调过程中保持一般领域能力。
- 对剩余未剪枝的参数在目标领域数据上进行微调,以适应领域特定的模式。
- 通过在每个新领域上顺序剪枝与微调,将该方法迭代扩展以支持多个领域。
- 该方法避免了模型结构修改,无需架构变更或引入额外参数。
- 该方法借鉴持续学习与彩票假说的原理,以识别有效的稀疏子网络。
实验结果
研究问题
- RQ1能否从一般领域 NMT 模型中自动发现一个稀疏子网络,使其在一般任务上保持高性能?
- RQ2仅微调未剪枝参数是否能防止灾难性遗忘,同时提升目标领域的性能?
- RQ3Prune-Tune 是否可通过单一模型支持多个互不重叠的领域?
- RQ4在目标领域与一般领域性能方面,Prune-Tune 与强基线方法(如微调、EWC 和适配器)相比表现如何?
- RQ5使用 Prune-Tune 实现有效领域自适应所需的最小参数预算是多少?
主要发现
- 在 En→De 翻译任务的目标领域测试集上,Prune-Tune 的表现优于标准微调、EWC、模型蒸馏、层冻结和基于适配器的方法。
- 该方法保持或甚至提升了通用领域性能,避免了标准微调中常见的性能下降。
- 在 En→De 基准测试中,Prune-Tune 在目标领域上的 BLEU 分数相比标准微调最高提升 4.2 分。
- 实验表明,大多数领域仅需微调 5% 的模型参数,而 1% 的参数微调即可实现相近性能。
- 在多领域自适应中,该方法对不同学习顺序具有鲁棒性,不同领域适应顺序之间的 BLEU 分数差距极小。
- Prune-Tune 使单一模型能够无性能退化地服务多个领域,展现出良好的可扩展性与参数效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。