QUICK REVIEW
[论文解读] MetaMT,a MetaLearning Method Leveraging Multiple Domain Data for Low Resource Machine Translation
Rumeng Li, Xun Wang|arXiv (Cornell University)|Dec 11, 2019
Natural Language Processing Techniques参考文献 53被引用 10
一句话总结
本文提出 MetaMT,一种用于低资源神经机器翻译的元学习框架,通过利用多种领域数据来提升领域适应能力。通过将模型参数分为元参数和基础参数,并使用领域特定的词嵌入投影在共享语义空间中,MetaMT 在低资源领域实现了显著的 BLEU 分数提升——最高达 2.0 分,包括在 3,020 条句子的电子健康记录(EHR)数据集上达到 42.20 的 BLEU 分数,优于标准 Transformer 模型和微调基线模型。
ABSTRACT
Manipulating training data leads to robust neural models for MT.
研究动机与目标
- 解决在特定领域训练数据稀缺时神经机器翻译(NMT)性能不佳的挑战。
- 克服低资源翻译设置中因词汇差异和一词多义导致的领域差异问题。
- 开发一种参数高效的策略,仅使用少量领域内句子即可实现对新领域的快速适应。
- 通过使用基础词将词语投影到共享语义空间,减少领域间的数据稀疏性和词汇不匹配问题。
- 设计一种元学习训练策略,交替更新模型参数和元参数,以增强跨领域的泛化能力。
提出的方法
- 将模型参数分为两组:用于翻译的模型参数和用于调整表示空间以实现跨领域泛化的元参数。
- 引入一个传输层,将来自由基础词定义的共享语义空间的词向量映射到领域特定的表示。
- 采用一种元学习训练策略,交替进行在多样化领域的预训练和在目标领域小样本数据上的微调。
- 在微调过程中冻结模型参数,仅更新元参数,以实现对新领域的快速适应。
- 使用 20K 个子词操作的字节对编码(BPE)方法,以减少领域间的 OOV(未登录词)数量。
- 在多个领域特定的数据集上进行训练,以模拟领域适应,并初始化元参数,实现对未见领域的快速适应。
实验结果
研究问题
- RQ1元学习能否提升 NMT 模型在低资源领域中的零样本或少样本适应能力?
- RQ2使用基础词的共享语义空间在减少领域差异和词汇不匹配方面有多有效?
- RQ3分离模型参数和元参数是否能提升低资源翻译中的泛化能力和快速适应能力?
- RQ4所提出的方法是否能在极小的领域内数据集上超越标准微调和迁移学习基线模型?
- RQ5该方法在电子健康记录等高度专业化的领域中表现如何,尤其是在并行数据有限的情况下?
主要发现
- 在包含 3,020 条句子的电子健康记录(EHR)数据集上,MetaMT 达到了 42.20 的 BLEU 分数,优于标准 Transformer(36.38)和微调后的 Transformer(40.61)。
- 在多个领域数据集上,与基线方法相比,MetaMT 的 BLEU 分数提升了 1.0 至 2.0 分,仅在包含多样化、罕见词汇的 UN 数据和 EU Bookshop 数据集上例外。
- 即使在 EHR 数据集中仅有 2,171 对训练句子对的情况下,该模型也表现出色,显示出对极小领域内数据的强鲁棒性。
- 消融实验证明,若同时移除编码器和解码器的嵌入投影,性能会显著下降,证实了共享语义空间的重要性。
- 元学习策略通过在微调过程中冻结模型参数并仅更新元参数,实现了快速适应,减少了过拟合并提升了领域泛化能力。
- 该方法具有语言无关性,无需语言特定特征,因此可适用于任意语言对。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。