Skip to main content
QUICK REVIEW

[논문 리뷰] LadaBERT: Lightweight Adaptation of BERT through Hybrid Model Compression

Yihuan Mao, Yujing Wang|arXiv (Cornell University)|2020. 04. 08.
Topic Modeling참고 문헌 32인용 수 19
한 줄 요약

LadaBERT는 가중치 프루닝, 행렬 분해, 지식 정련을 조합한 하이브리드 모델 압축 프레임워크를 제안하여 훈련 비용을 크게 줄인 경량 BERT 변종을 생성한다. 기존 정련 기반 방법에 비해 훈련 속도를 최대 한 단계 빠르게 하면서도 여러 NLU 벤치마크에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

BERT is a cutting-edge language representation model pre-trained by a large corpus, which achieves superior performances on various natural language understanding tasks. However, a major blocking issue of applying BERT to online services is that it is memory-intensive and leads to unsatisfactory latency of user requests, raising the necessity of model compression. Existing solutions leverage the knowledge distillation framework to learn a smaller model that imitates the behaviors of BERT. However, the training procedure of knowledge distillation is expensive itself as it requires sufficient training data to imitate the teacher model. In this paper, we address this issue by proposing a hybrid solution named LadaBERT (Lightweight adaptation of BERT through hybrid model compression), which combines the advantages of different model compression methods, including weight pruning, matrix factorization and knowledge distillation. LadaBERT achieves state-of-the-art accuracy on various public datasets while the training overheads can be reduced by an order of magnitude.

연구 동기 및 목표

  • 기존 BERT 압축 방법이 광범위한 재학습에 의존함에 따라 발생하는 높은 계산 및 데이터 비용을 해결하기 위해.
  • 성능을 희생시키지 않고 더 작은 BERT 모델을 정련하기 위한 훈련 오버헤드를 줄이기 위해.
  • 메모리 및 지연 시간 제약 조건 하에서 작업 적응형 BERT 모델을 생성하기 위한 가벼우며 효율적인 파ip라인을 개발하기 위해.
  • 다양한 압축 기법을 하나의 반복적 프레임워크에 통합할 때 발생하는 상호보완적 효과를 탐색하기 위해.

제안 방법

  • LadaBERT는 사전 훈련된 BERT 교사 모델에서 시작하는 반복적 하이브리드 압축 파이프라인을 사용한다.
  • 각 반복 단계에서 학생 모델은 가중치 프루닝과 행렬 분해를 통해 파rameter 수를 줄인다.
  • 압축된 학생 모델은 교사 모델의 소프트 레이블을 사용하여 지식 정련을 통해 미세조정된다.
  • 행렬 분해는 SVD를 통해 수행되어 가중치 행렬을 낮은 질량의 구성요소로 분해한다.
  • 이 과정은 희소성(프루닝)과 낮은 랭크 구조(분해)를 결합하여 정련 효율성을 향상시킨다.
  • 목표 압축 비율을 달성하면서 정확도를 유지하기 위해 반복적으로 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1가중치 프루닝과 행렬 분해를 조합하면 BERT 압축에서 지식 정련의 효율성과 정확도를 향상시킬 수 있는가?
  • RQ2순수한 정련 방법에 비해 하이브리드 압축은 훈련 시간과 자료 요구량을 얼마나 줄일 수 있는가?
  • RQ3다양한 압축 기법을 반복적으로 적용하면 단일 기법 대비 더 나은 성능을 내는가?
  • RQ4LadaBERT의 하이브리드 접근 방식은 정확도와 훈련 속도 측면에서 TinyBERT나 DistilBERT와 같은 최신 기술 수준의 모델에 비해 어떻게 비교되는가?

주요 결과

  • LadaBERT는 다섯 개인공 NLU 데이터셋에서 최신 기술 수준의 정확도를 달성하며, 다양한 압축 비율에서 기존의 압축 기반 베이스라인을 모두 능가한다.
  • 2.5배 압축 비율에서 LadaBERT는 BERT-PKD보다 정확도에서 뚜렷한 승리를 거두며 훈련 시간을 한 단계 줄였다.
  • 7.5배 압축 비율에서 LadaBERT는 MNLI-m 및 QQP 데이터셋에서 TinyBERT를 성능 면에서 능가하며 수렴 속도를 10배 빠르게 했다.
  • LadaBERT-3는 초기 훈련된 BERT-Small와 경쟁 가능한 성능을 보였지만, 훨씬 낮은 훈련 비용을 요구했다.
  • 하이브리드 프루닝 방법(SVD + 가중치 프루닝)은 순수한 프루닝이나 분해만을 사용하는 것보다 더 부드러운 편향 분포와 더 나은 미세조정 안정성을 제공한다.
  • 학습 곡선 분석 결과, LadaBERT는 MNLI-m에서 약 20,000단계 만에 수렴하는 반면, TinyBERT는 약 200,000단계가 소요되어 10배의 속도 향상을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.