[논문 리뷰] Distilling BERT into Simple Neural Networks with Unlabeled Transfer Data
이 논문은 도메인 내 레이블이 없는 전이 데이터를 사용하여 대규모 사전 훈련된 BERT 모델을 단순한 RNN 기반 학생 네트워크로 정제하는 방법을 제안하며, 성능이 교사 모델과 동일하거나 이를 초월한다. 최대 26배의 파라미터 압축과 51배의 지연 시간 감소를 이룩함으로써, 레이블이 제한된 데이터만으로도 41개 언어에서 BERT의 F1 점수의 95%를 유지한다.
Recent advances in pre-training huge models on large amounts of text through self supervision have obtained state-of-the-art results in various natural language processing tasks. However, these huge and expensive models are difficult to use in practise for downstream tasks. Some recent efforts use knowledge distillation to compress these models. However, we see a gap between the performance of the smaller student models as compared to that of the large teacher. In this work, we leverage large amounts of in-domain unlabeled transfer data in addition to a limited amount of labeled training instances to bridge this gap for distilling BERT. We show that simple RNN based student models even with hard distillation can perform at par with the huge teachers given the transfer set. The student performance can be further improved with soft distillation and leveraging teacher intermediate representations. We show that our student models can compress the huge teacher by up to 26x while still matching or even marginally exceeding the teacher performance in low-resource settings with small amount of labeled data. Additionally, for the multilingual extension of this work with XtremeDistil (Mukherjee and Hassan Awadallah, 2020), we demonstrate massive distillation of multilingual BERT-like teacher models by upto 35x in terms of parameter compression and 51x in terms of latency speedup for batch inference while retaining 95% of its F1-score for NER over 41 languages.
연구 동기 및 목표
- BERT와 같은 대규모이고 계산 비용이 큰 사전 훈련된 언어 모델을 자원이 제한된 환경 및 실사용 환경에 구현하는 데 도전하는 것.
- 다량의 도메인 내 레이블이 없는 전이 데이터를 활용하여 자원이 제한된 환경에서 작은 학생 모델의 성능을 향상시키는 것.
- 지식 정제를 통해 단순한 RNN 기반 학생 아키텍처가 대규모 BERT 교사 모델의 성능을 따라하거나 초월할 수 있는지 탐색하는 것.
- 훈련 스케줄, 정제 목표 함수, 교사 모델의 용량이 학생 모델 성능에 미치는 영향을 조사하는 것.
제안 방법
- 두 단계 훈련 스케줄 사용: 먼저 레이블이 없는 데이터에서 표현 손실을 최적화하고, 이후 점진적으로 레이어를 해제하면서 레이블이 있는 데이터에서 로짓과 교차 엔트로피 손실을 동시에 최적화.
- 교사 모델의 예측된 클래스 레이블을 학생 모델의 타겟으로 사용하는 하드 정제 적용.
- 교사의 온도 조정된 소프트 레이블을 사용해 일반화 성능을 향상시키기 위해 소프트 정제를 통한 성능 향상.
- 최종 로짓을 초월해 교사 네트워크의 중간 은닉 표현을 활용해 학생 학습을 안내하는 방법.
- 레이블이 없는 데이터에서 사전 훈련 없이 BiLSTM 기반 학생 모델을 훈련시키며, 대신 교사로부터 지식 정제에 의존.
- 레이블이 있는 데이터에서의 교차 엔트로피 손실과 교사의 출력 및 은닉 상태로부터 유도된 정제 손실의 조합을 사용해 학생 모델 최적화.
실험 결과
연구 질문
- RQ1지식 정제와 도메인 내 레이블이 없는 데이터를 사용해 훈련된 단순한 RNN 기반 학생 모델이 대규모 BERT 교사 모델의 성능을 따라할 수 있는가?
- RQ2다량의 레이블이 없는 전이 데이터를 포함시킬 경우, 자원이 제한된 환경에서 학생 모델의 성능에 어떤 영향을 미치는가?
- RQ3작은 학생 모델의 정제 성능을 높이기 위해 어떤 훈련 스케줄과 손실 조합이 가장 효과적인가?
- RQ4소프트 정제 또는 중간 표현 정제가 하드 정제를 초월해 학생 모델의 성능을 향상시키는가?
- RQ5학생 모델의 크기가 고정된 상태에서 교사 모델의 크기가 정제 성능에 어떤 영향을 미치는가?
주요 결과
- 단순한 BiLSTM 기반 학생 모델은 최대 26배의 파라미터 압축을 이룩함에도 불구하고, BERT Base 및 BERT Large와 동등한 성능을 달성한다.
- 레이블 데이터가 제한된 자원이 제한된 환경에서 학생 모델의 성능이 교사 모델을 약간 초월한다.
- 소프트 정제와 중간 표현 정제가 하드 정제를 초월해 학생 모델의 성능을 추가로 향상시킨다.
- 이 방법은 다국어 BERT 유사 모델에 대해 최대 35배의 파라미터 압축과 51배의 지연 시간 감소를 이룩하며, 41개 언어에서 F1 점수의 95%를 유지한다.
- 점진적 레이어 해제를 포함한 단계적 훈련이 공동 최적화보다 더 뛰어난 정제 성능을 낳는다.
- 학생 모델 크기가 포화 상태에 도달한 후에는 더 큰 교사 모델이 정제 성능 향상에 미치는 기여가 미미하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.