Skip to main content
QUICK REVIEW

[논문 리뷰] The Microsoft Toolkit of Multi-Task Deep Neural Networks for Natural Language Understanding

Xiaodong Liu, Yu Wang|ArXiv.org|2020. 02. 19.
Topic Modeling참고 문헌 48인용 수 15
한 줄 요약

MT-DNN는 자연어 이해를 위한 오픈소스 파이토치 기반 툴킷으로, 통합 다중 작업 학습, 적대적 훈련, 지식 정복을 통해 모델의 강건성, 이식성, 배포 효율성을 향상시킵니다. 사전 훈련된 모델과 엔드 투 엔드 미세조정, 모델 압축을 융합하여 GLUE, ANLI 및 생물의학 기준 평가에서 최신 기술 성능을 달성합니다.

ABSTRACT

We present MT-DNN, an open-source natural language understanding (NLU) toolkit that makes it easy for researchers and developers to train customized deep learning models. Built upon PyTorch and Transformers, MT-DNN is designed to facilitate rapid customization for a broad spectrum of NLU tasks, using a variety of objectives (classification, regression, structured prediction) and text encoders (e.g., RNNs, BERT, RoBERTa, UniLM). A unique feature of MT-DNN is its built-in support for robust and transferable learning using the adversarial multi-task learning paradigm. To enable efficient production deployment, MT-DNN supports multi-task knowledge distillation, which can substantially compress a deep neural model without significant performance drop. We demonstrate the effectiveness of MT-DNN on a wide range of NLU applications across general and biomedical domains. The software and pre-trained models will be publicly available at https://github.com/namisan/mt-dnn.

연구 동기 및 목표

  • 생산 환경에서 대규모 고성능 NLP 모델을 효율적으로 배포하기 위한 도전 과제를 해결하기 위해 모델 압축을 효율적으로 가능하게 합니다.
  • 통합된 적대적 훈련과 다중 작업 학습을 통해 모델의 일반화 능력과 강건성을 향상시킵니다.
  • 다양한 NLU 작업과 사전 훈련된 인코더에 맞게 맞춤형 딥러닝 모델을 커스터마이징할 수 있는 통합적이고 확장 가능한 프레임워크를 제공합니다.
  • 일반 및 생물의학 NLP 응용 프로그램을 모두 지원하며, 작업별 미세조정과 사전 훈련된 모델 통합을 제공합니다.
  • 사전 훈련, 다중 작업 미세조정, 적대적 훈련, 지식 정복을 포함하는 엔드 투 엔드 훈련 파이프라인을 가능하게 합니다.

제안 방법

  • MT-DNN는 분류, 회귀, 구조적 예측 작업 전반에 걸쳐 다중 작업 학습을 위해 공유 인코더(예: BERT, RoBERTa, UniLM)와 작업별 헤드를 사용합니다.
  • 역전파 과정에서 기울기 기반 변형을 통합함으로써 적대적 훈련을 지원하여 모델의 강건성을 향상시킵니다.
  • 앙상블 교사 모델의 소프트 레이블 지도를 통해 지식 정복을 적용하여 성능 손실 없이 더 작은 아키텍처(예: LSTMs)로의 압축을 가능하게 합니다.
  • 데이터 형식, 손실 함수, 평가 지표, 모델 아키텍처를 정의하는 설정 파일에 의해 프레임워크가 구동되어 쉽게 커스터마이징할 수 있습니다.
  • 마스크된 언어 모델링을 사용해 사전 훈련된 모델에서의 전이 학습과 함께, 초기부터 사전 훈련하는 것도 지원합니다.
  • 설정 파일을 통해 커스텀 손실 함수와 작업 헤드를 통합할 수 있어 새로운 작업과 아키텍처에 대한 확장성이 뛰어납니다.

실험 결과

연구 질문

  • RQ1다중 작업 학습과 적대적 훈련을 융합함으로써 다양한 작업에서 NLU 모델의 강건성과 일반화 능력이 향상되는가?
  • RQ2온라인 배포를 위한 성능을 유지하면서 대규모 사전 훈련된 모델을 압축하는 데 지식 정복이 얼마나 효과적인가?
  • RQ3MT-DNN의 통합 프레임워크가 일반 및 생물의학 NLP 기준 평가에서 성능 향상에 얼마나 기여하는가?
  • RQ4적대적 훈련과 다중 작업 학습이 ANLI 및 GLUE와 같은 도전적인 기준 평가에서 모델 성능을 함께 향상시키는가?
  • RQ5이 툴킷은 BioBERT와 같은 도메인 전용 사전 훈련된 모델과의 통합을 위해 새로운 NLU 작업에 대해 얼마나 잘 커스터마이징 가능한가?

주요 결과

  • GLUE 기준 평가에서 통합 다중 작업 학습과 적대적 훈련은 단일 작업 미세조정보다 유의미하게 뛰어난 성능을 보였으며, BERT + MTL 및 BERT + AdvTrain는 기준 모델을 초월한 성능 향상을 보였습니다.
  • ANLI 기준 평가에서 RoBERTa-LARGE에 적대적 훈련을 적용한 결과, MNLI, SNLI, FEVER 데이터셋 전반에서 강력한 기준 모델을 뛰어넘는 최신 기술 성능을 달성했습니다.
  • 이 툴킷은 표준 및 생물의학 전용 사전 훈련된 모델을 사용해 생물의학 NLP 작업(예: 명명된 실체 인식, 관계 추출, 질의 응답)에서 고성능의 미세조정을 성공적으로 구현했습니다.
  • 지식 정복을 통해 성능 손실가 최소화된 상당한 모델 압축이 가능해졌으며, 자원 제약 환경에서 더 작은 모델(예: 디스틸드 BERT 또는 LSTMs)의 배포가 가능해졌습니다.
  • 설정 기반 설계 덕분에 SNLI와 같은 새로운 작업으로의 원활한 적응이 가능했으며, 최소한의 코드 변경과 함께 커스텀 손실 함수 및 모델 헤드 전부를 지원했습니다.
  • 프레임워크는 강력한 확장성을 보였으며, 설정 파일을 통해 사용자가 커스텀 모델과 손실 함수를 쉽게 통합할 수 있어 빠른 프로토타이핑과 배포를 가능하게 했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.