Skip to main content
QUICK REVIEW

[论文解读] YANMTT: Yet Another Neural Machine Translation Toolkit

Raj Dabre, Eiichiro Sumita|arXiv (Cornell University)|Aug 25, 2021
Natural Language Processing Techniques参考文献 24被引用 5
一句话总结

YANMTT 是一个基于 Hugging Face Transformers 库构建的开源、面向初学者的神经机器翻译工具包,支持多语言 NMT 模型的端到端预训练、微调、模型压缩与分析。它支持分布式训练、选择性参数迁移、知识蒸馏,以及同步翻译、文档/多源翻译等高级 NMT 范式,在资源丰富(如日语-英语任务中达到 39.96 BLEU)和低资源(如印地语-英语任务中达到 35.80 BLEU)设置下均实现了最先进性能。

ABSTRACT

In this paper we present our open-source neural machine translation (NMT) toolkit called "Yet Another Neural Machine Translation Toolkit" abbreviated as YANMTT which is built on top of the Transformers library. Despite the growing importance of sequence to sequence pre-training there surprisingly few, if not none, well established toolkits that allow users to easily do pre-training. Toolkits such as Fairseq which do allow pre-training, have very large codebases and thus they are not beginner friendly. With regards to transfer learning via fine-tuning most toolkits do not explicitly allow the user to have control over what parts of the pre-trained models can be transferred. YANMTT aims to address these issues via the minimum amount of code to pre-train large scale NMT models, selectively transfer pre-trained parameters and fine-tune them, perform translation as well as extract representations and attentions for visualization and analyses. Apart from these core features our toolkit also provides other advanced functionalities such as but not limited to document/multi-source NMT, simultaneous NMT and model compression via distillation which we believe are relevant to the purpose behind our toolkit.

研究动机与目标

  • 为从零开始预训练大规模 NMT 模型提供一个初学者友好、代码量极少的工具包,以解决当前缺乏此类工具的现状。
  • 在微调过程中提供对参数迁移的细粒度控制,支持选择性地适配预训练组件。
  • 支持高级 NMT 范式,如同步翻译、文档级/多源翻译,以及通过知识蒸馏实现的模型压缩。
  • 简化分布式训练与模型分析流程,包括注意力可视化与表征提取。
  • 使高校及小型组织的研究人员能够无需依赖 Fairseq 等大型复杂代码库,即可预训练领域或语言特定的模型。

提出的方法

  • 基于 Hugging Face Transformers 库构建,以利用其简洁性与生态系统,便于访问预训练模型与微调流程。
  • 采用极简且注释详尽的代码库,提升可读性与初学者的可修改性。
  • 通过在单语语料上进行数据填充,支持使用可配置采样温度来平衡语言侧重的分布式多语言 NMT 预训练。
  • 在微调过程中通过允许用户指定冻结或更新的模型组件,实现选择性参数迁移。
  • 通过知识蒸馏与参数共享实现模型压缩,以降低推理延迟。
  • 提供统一的脚本用于解码、注意力可视化与表征提取,提升模型分析与可解释性。

实验结果

研究问题

  • RQ1一个轻量级、面向初学者的工具包是否能以极少代码与最大透明度,有效支持全规模 NMT 预训练与微调?
  • RQ2在低资源与多语言翻译设置下,微调过程中的选择性参数迁移对性能有何影响?
  • RQ3知识蒸馏与参数共享在不造成显著精度损失的前提下,能在多大程度上减小模型尺寸与推理延迟?
  • RQ4统一工具包能否高效支持多种 NMT 范式,如同步翻译、文档级翻译与多源翻译,同时兼容标准的序列到序列训练?
  • RQ5使用 YANMTT 训练的模型在资源丰富与低资源语言对上的性能,与最先进基线相比如何?

主要发现

  • YANMTT 工具包在日语-英语翻译任务中取得了 39.96 的 BLEU 分数,与其它成熟工具包的结果相当。
  • 对于低资源的印度语言,微调 MBART 模型带来了显著性能提升,其中印地语-英语方向的 BLEU 分数从 28.21 提升至 35.80。
  • 在 11 种印度语言与英语上预训练的 MBART 模型在 MultiIndicMT 基准测试中表现优异,证明了多语言预训练的有效性。
  • 该工具包成功实现了在 48 块 V-100 GPU 上的分布式训练,MBART 模型的预训练过程约在一天内完成。
  • 预训练过程中使用数据填充与基于温度的采样策略,有助于平衡语言覆盖范围,并提升低资源语言的泛化能力。
  • 该工具包模块化的设计与详尽的注释,有助于理解与扩展,支持 NMT 预训练与迁移学习的深入研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。