Skip to main content
QUICK REVIEW

[论文解读] The Microsoft Toolkit of Multi-Task Deep Neural Networks for Natural Language Understanding

Xiaodong Liu, Yu Wang|ArXiv.org|Feb 19, 2020
Topic Modeling参考文献 48被引用 15
一句话总结

MT-DNN 是一个基于 PyTorch 的开源自然语言理解工具包,支持联合多任务学习、对抗性训练和知识蒸馏,以提升模型的鲁棒性、可迁移性和部署效率。通过结合预训练模型与端到端微调及模型压缩技术,该工具包在 GLUE、ANLI 和生物医学基准测试中均取得了最先进性能。

ABSTRACT

We present MT-DNN, an open-source natural language understanding (NLU) toolkit that makes it easy for researchers and developers to train customized deep learning models. Built upon PyTorch and Transformers, MT-DNN is designed to facilitate rapid customization for a broad spectrum of NLU tasks, using a variety of objectives (classification, regression, structured prediction) and text encoders (e.g., RNNs, BERT, RoBERTa, UniLM). A unique feature of MT-DNN is its built-in support for robust and transferable learning using the adversarial multi-task learning paradigm. To enable efficient production deployment, MT-DNN supports multi-task knowledge distillation, which can substantially compress a deep neural model without significant performance drop. We demonstrate the effectiveness of MT-DNN on a wide range of NLU applications across general and biomedical domains. The software and pre-trained models will be publicly available at https://github.com/namisan/mt-dnn.

研究动机与目标

  • 为了解决在生产环境中部署大型高性能 NLP 模型的挑战,通过支持高效的模型压缩来实现。
  • 通过集成对抗性训练和多任务学习,提升模型的泛化能力和鲁棒性。
  • 提供一个统一且可扩展的框架,用于在多样化 NLU 任务和预训练编码器上自定义深度学习模型。
  • 支持通用和生物医学 NLP 应用,通过特定任务的微调和预训练模型集成。
  • 支持包含预训练、多任务微调、对抗性训练和知识蒸馏的端到端训练流水线。

提出的方法

  • MT-DNN 使用共享编码器(如 BERT、RoBERTa、UniLM),并为各类分类、回归和结构化预测任务配备特定任务的头,以实现多任务学习。
  • 通过在反向传播过程中引入基于梯度的扰动,支持对抗性训练,以提升模型鲁棒性。
  • 通过集成教师模型的软标签监督实施知识蒸馏,实现将大模型压缩至更小架构(如 LSTMs)而几乎不损失准确率。
  • 框架由配置文件驱动,用于定义数据格式、损失函数、评估指标和模型架构,从而实现轻松定制。
  • 支持从预训练模型进行迁移学习,也支持使用掩码语言建模从零开始预训练。
  • 可通过配置文件插入自定义损失函数和任务头,支持新任务和新架构的可扩展性。

实验结果

研究问题

  • RQ1结合多任务学习与对抗性训练是否能显著提升 NLU 模型在多样化任务上的鲁棒性和泛化能力?
  • RQ2知识蒸馏在压缩大型预训练模型的同时,能否有效保持其性能,以支持在线部署?
  • RQ3MT-DNN 的统一框架在通用和生物医学 NLP 基准测试中,能在多大程度上提升性能?
  • RQ4对抗性训练与多任务学习是否能协同提升模型在 ANLI 和 GLUE 等挑战性基准上的表现?
  • RQ5该工具包在支持新 NLU 任务的定制化以及与领域特定预训练模型(如 BioBERT)的集成方面表现如何?

主要发现

  • 在 GLUE 基准测试中,联合多任务学习与对抗性训练显著优于单任务微调,BERT + MTL 和 BERT + AdvTrain 均优于基线模型。
  • 在 ANLI 基准测试中,RoBERTa-LARGE 搭配对抗性训练取得了最先进结果,在 MNLI、SNLI 和 FEVER 数据集上均超越了强基线模型。
  • 该工具包成功实现了在生物医学 NLP 任务(包括命名实体识别、关系抽取和问答)上的高性能微调,无论使用通用模型还是生物医学专用预训练模型。
  • 知识蒸馏实现了显著的模型压缩,且性能损失极小,使小型模型(如蒸馏后的 BERT 或 LSTMs)可在资源受限环境中部署。
  • 配置驱动的设计使新任务(如 SNLI)的适配变得无缝,仅需极少代码修改,并完全支持自定义损失函数和模型头。
  • 该框架展现出强大的可扩展性,用户可通过配置文件轻松插入自定义模型和损失函数,从而加速原型设计与部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。