Skip to main content
QUICK REVIEW

[논문 리뷰] MKD: a Multi-Task Knowledge Distillation Approach for Pretrained Language Models

Linqing Liu, Huan Wang|arXiv (Cornell University)|2019. 11. 09.
Topic Modeling참고 문헌 45인용 수 19
한 줄 요약

이 논문은 여러 NLP 작업을 통해 다중 작업 BERT 교사로부터 경량 학생 모델을 동시에 정제하는 다중 작업 지식 정제 프레임워크인 MKD를 제안한다. 다양한 작업에서의 공유 표현을 활용함으로써 MKD는 더 빠른 추론을 통해 최신 기술 성능을 달성한다—외부 코퍼스 없이 다운스트림 작업 데이터만을 사용함으로써 BERT-PKD와 TinyBERT를 뛰어넘는 속도를 기록하면서도 정확도는 그들과 동일하거나 초월한다.

ABSTRACT

Pretrained language models have led to significant performance gains in many NLP tasks. However, the intensive computing resources to train such models remain an issue. Knowledge distillation alleviates this problem by learning a light-weight student model. So far the distillation approaches are all task-specific. In this paper, we explore knowledge distillation under the multi-task learning setting. The student is jointly distilled across different tasks. It acquires more general representation capacity through multi-tasking distillation and can be further fine-tuned to improve the model in the target domain. Unlike other BERT distillation methods which specifically designed for Transformer-based architectures, we provide a general learning framework. Our approach is model agnostic and can be easily applied on different future teacher model architectures. We evaluate our approach on a Transformer-based and LSTM based student model. Compared to a strong, similarly LSTM-based approach, we achieve better quality under the same computational constraints. Compared to the present state of the art, we reach comparable results with much faster inference speed.

연구 동기 및 목표

  • 대규모 미사전처리된 언어 모델의 높은 계산 비용과 추론 지연 문제를 해결하기 위해.
  • 각각의 새로운 작업에 대해 재학습이 필요한 작업별 지식 정제의 한계를 극복하기 위해.
  • 다양한 학생 아키텍처에 적용 가능한 일반적이고 모델에 종속되지 않는 정제 프레임워크를 개발하기 위해.
  • 정제 과정에서 다중 작업 학습을 활용하여 학생 모델의 성능과 추론 속도를 향상시키기 위해.
  • 정제 과정에서 대규모 외부 텍스트 코퍼스에 대한 의존도를 줄여 데이터 가용성과 개인정보 보호 준수를 향상시키기 위해.

제안 방법

  • 다양한 NLP 작업을 통해 다중 작업 BERT 교사로부터 학생 모델을 동시에 정제함으로써 공유 표현 학습이 가능해진다.
  • 정제 과정은 동시에 여러 작업의 지식을 활용하여 학생 모델의 일반화 능력과 강건성을 향상시킨다.
  • 프레임워크는 모델에 종속되지 않아 Transformer 기반 및 LSTM 기반 학생 모델 모두에 적용 가능하다.
  • 외부 학습 데이터가 필요 없이 다운스트림 작업 데이터만을 기반으로 하여 다중 작업 간 지식 전이를 수행한다.
  • 시퀀스 모델링 능력을 향상시키기 위해 LSTM 기반 학생 모델에 이중 주의 메커니즘을 통합한다.
  • 어휘 크기를 줄이고 희귀어 처리 능력을 향상시키기 위해 WordPiece 토크나이저를 사용한다.

실험 결과

연구 질문

  • RQ1다중 작업 정제는 다양한 NLP 작업에서 정제된 학생 모델의 성능과 일반화 능력을 향상시킬 수 있는가?
  • RQ2여러 작업으로부터의 공동 정제는 작업별 정제에 비해 더 빠른 추론과 뛰어난 효율성을 제공하는가?
  • RQ3큰 외부 텍스트 코퍼스에 의존하지 않으면서도 경쟁력 있는 성능을 유지할 수 있는 정제 프레임워크는 가능한가?
  • RQ4주의 메커니즘의 통합은 경량 LSTM 기반 학생 모델의 성능에 어떤 영향을 미치는가?
  • RQ5다양한 토크나이저 전략은 정제 효과성에 어떤 영향을 미치는가?

주요 결과

  • MKD-LSTM는 추론 속도가 2.93초로 Distilled BiLSTM(1.36초)보다 빠르면서도 더 높은 정확도를 유지하여 뛰어난 효율성과 성능을 입증한다.
  • BERT-PKD와 TinyBERT에 비해 외부 학습 데이터를 사용하지 않음에도 불구하고 동등하거나 뛰어난 성능을 달성한다.
  • 모든 작업에서 훈련된 다중 작업 정제된 LSTM 모델은 단일 작업 정제보다 RTE에서 1.4점 높은 성능을 보이며, 다중 작업 간 지식 공유의 이점을 입증한다.
  • LSTM 학생 모델에 통합된 이중 주의 메커니즘은 단순한 BiLSTM에 비해 성능을 크게 향상시키며, 여섯 개의 데이터셋에서 2.2~6.1점의 향상이 관찰된다.
  • WordPiece 토크나이저는 어휘 크기를 줄이고 희귀어 처리 능력을 향상시켜 단어 수준의 토크나이저보다 더 나은 전체 성능을 이끌어낸다.
  • MKD는 네 가지 작업에 걸쳐 일곱 개의 데이터셋에서 최신 기술 성능을 달성하며, 정확도와 추론 속도 양면에서 기존의 정제 방법을 뛰어넘는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.