Skip to main content
QUICK REVIEW

[논문 리뷰] MiniLMv2: Multi-Head Self-Attention Relation Distillation for Compressing Pretrained Transformers

Wenhui Wang, Hangbo Bao|arXiv (Cornell University)|2020. 12. 31.
Topic Modeling참고 문헌 45인용 수 15
한 줄 요약

이 논문은 사전 학습된 트랜스포머 모델을 압축하기 위해 다중 헤드 자기주의 주의 관계 distillation을 사용하는 MiniLMv2를 제안한다. 이 방법은 교사 모델과 학생 모델의 어텐션 헤드 수가 일치할 필요가 없으며, 쿼리, 키, 밸류 벡터 간의 세밀한 스케일드 도트곱 관계를 여러 관계 헤드를 통해 추출함으로써 상태의 성능을 달성한다. 단일 언어 및 다국어 작업에서 최고의 성능을 기록하며, BERT Large에서 유도된 6×768 모델는 BERT Base를 능가하면서도 2배 빠른 속도로 추론한다.

ABSTRACT

We generalize deep self-attention distillation in MiniLM (Wang et al., 2020) by only using self-attention relation distillation for task-agnostic compression of pretrained Transformers. In particular, we define multi-head self-attention relations as scaled dot-product between the pairs of query, key, and value vectors within each self-attention module. Then we employ the above relational knowledge to train the student model. Besides its simplicity and unified principle, more favorably, there is no restriction in terms of the number of student's attention heads, while most previous work has to guarantee the same head number between teacher and student. Moreover, the fine-grained self-attention relations tend to fully exploit the interaction knowledge learned by Transformer. In addition, we thoroughly examine the layer selection strategy for teacher models, rather than just relying on the last layer as in MiniLM. We conduct extensive experiments on compressing both monolingual and multilingual pretrained models. Experimental results demonstrate that our models distilled from base-size and large-size teachers (BERT, RoBERTa and XLM-R) outperform the state-of-the-art.

연구 동기 및 목표

  • 교사 모델과 학생 모델의 어텐션 헤드 수가 동일해야 하는 지식 전이의 한계를 해결하기 위해.
  • 단순히 어텐션 분포가 아닌 세밀한 자기주의 주의 관계를 활용하여 모델 압축을 향상시키기 위해.
  • 특히 많은 레이어를 가진 대규모 모델에서 최적의 교사 레이어를 식별하기 위해.
  • 과제에 종속되지 않는 distillation을 통해 단일 언어 및 다국어 환경에서 최고의 성능을 달성하기 위해.
  • 교사 모델의 어텐션 헤드 수와 분리하여 학생 모델의 설계 유연성을 높이기 위해.

제안 방법

  • 이 방법은 각 자기주의 주의 모듈 내에서 쿼리, 키, 밸류 벡터 쌍 간의 스케일드 도트곱 연산을 다중 헤드 자기주의 주의 관계로 정의한다.
  • 학습자 모델의 어텐션 헤드 수와 다를 수 있는 관계 헤드 수를 설정할 수 있도록, 어텐션 헤드 출력을 연결하고 지정된 수의 관계 헤드로 분할하는 관계 헤드 메커니즘을 도입한다.
  • 교사 모델과 학생 모델의 Q-Q, K-K, V-V 관계 행렬 간의 L2 손실을 최소화함으로써 지식 전이를 수행한다.
  • 최종 레이어뿐만 아니라 교사 모델의 임의의 레이어에서 distillation이 가능하며, 실험 결과 대규모 모델의 경우 상단 중간 레이어가 더 높은 성능을 낸다.
  • 학생 모델의 아키텍처 제약 없이 마스크된 언어 모델링과 관계 distillation을 통합한 통합 학습 목표를 사용한다.
  • 관계 헤드 수가 학생 또는 교사의 헤드 수의 배수일 필요가 없어, 더 세밀하고 영리한 지식 전이가 가능하다.

실험 결과

연구 질문

  • RQ1교사 모델과 학생 모델의 어텐션 헤드 수가 다를 경우에도 자기주의 주의 관계 distillation이 모델 압축에 기여할 수 있는가?
  • RQ2대규모 교사 모델의 상단 중간 레이어(예: BERT Large의 24층 중 12층)에서의 지식 전이가 최종 레이어보다 더 높은 성능을 낼 수 있는가?
  • RQ3관계 헤드 수를 늘일수록 압축된 학생 모델의 성능에 어떤 영향을 미치는가?
  • RQ4다중 헤드 자기주의 주의 관계 distillation이 단일 언어 및 다국어 작업에서 기존의 지식 전이 방법을 능가할 수 있는가?
  • RQ5더 많은 자기주의 주의 관계를 사용할 경우 계산 비용 증가와의 상호 교환 관계는 어떠한가?

주요 결과

  • BERT Large에서 유도된 6×768 모델는 GLUE 벤치마크에서 BERT Base를 능가하면서 추론 속도가 2.0배 빠르다.
  • RoBERTa Large에서 유도된 학생 모델는 훨씬 적은 학습 예제로 RoBERTa Base를 능가하는 성능을 기록한다.
  • BERT Large 및 XLM-R Large와 같은 대규모 교사 모델에서 상단 중간 레이어(예: 24층 중 12층)를 사용할 경우 최종 레이어보다 더 높은 성능을 낸다.
  • 관계 헤드 수를 늘일수록 성능 향상이 이루어지며, 더 세밀한 지식 전이가 교사의 자기주의 주의 모듈을 더 잘 모방하게 된다.
  • Q-Q, K-K, V-V 관계를 전이하는 것이 Q-K 및 V-V 관계 전이보다 더 좋은 성능을 내며, 대부분의 GLUE 작업에서 MobileBERT를 능가하고 추론 속도도 빠르다.
  • 이 방법은 탄탄하고 일반화 가능하며, BERT, RoBERTa, XLM-R와 같은 다양한 대규모 모델에서 학생 모델의 아키텍처 제약 없이 distillation을 수행할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.