Skip to main content
QUICK REVIEW

[논문 리뷰] Distilling the Knowledge of Romanian BERTs Using Multiple Teachers

Andrei-Marius Avram, Darius Catrina|arXiv (Cornell University)|2021. 12. 23.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 단일 및 앙상블 교사 모델로부터 지식 정복을 통해 유도된 루마니아어용 세 가지 정련된 BERT 모델—Distil-BERT-base-ro, Distil-RoBERT-base, DistilMulti-BERT-base-ro—을 소개한다. 이 정련 모델들은 다섯 가지 NLP 작업에서 교사 모델과 유사한 성능를 달성하면서도 크기가 35% 작고 GPU에서 거의 두 배 빠른 성능를 보이며, 레이블, 확률, 회귀 지표에서 높은 예측 충실도를 확보한다.

ABSTRACT

Running large-scale pre-trained language models in computationally constrained environments remains a challenging problem yet to be addressed, while transfer learning from these models has become prevalent in Natural Language Processing tasks. Several solutions, including knowledge distillation, network quantization, or network pruning have been previously proposed; however, these approaches focus mostly on the English language, thus widening the gap when considering low-resource languages. In this work, we introduce three light and fast versions of distilled BERT models for the Romanian language: Distil-BERT-base-ro, Distil-RoBERT-base, and DistilMulti-BERT-base-ro. The first two models resulted from the individual distillation of knowledge from two base versions of Romanian BERTs available in literature, while the last one was obtained by distilling their ensemble. To our knowledge, this is the first attempt to create publicly available Romanian distilled BERT models, which were thoroughly evaluated on five tasks: part-of-speech tagging, named entity recognition, sentiment analysis, semantic textual similarity, and dialect identification. Our experimental results argue that the three distilled models offer performance comparable to their teachers, while being twice as fast on a GPU and ~35% smaller. In addition, we further test the similarity between the predictions of our students versus their teachers by measuring their label and probability loyalty, together with regression loyalty - a new metric introduced in this work.

연구 동기 및 목표

  • 루마니아어와 같은 저자원 언어에 대해 효율적이고 경량화된 BERT 모델의 부족을 해결하기 위해.
  • 실제 NLP 응용 프로그램에서 대규모 사전 훈련된 모델의 계산 및 환경 비용을 줄이기 위해.
  • 다양한 루마니아어 NLP 작업, 특히 당담어 식별과 같은 저자원 시나리오에서 정련 모델을 평가하기 위해.
  • 교사-학생 모델 간 예측 유사도를 측정하기 위해 새로운 충실도 지표—레이블 충실도, 확률 충실도, 회귀 충실도—를 도입하고 검증하기 위해.
  • 정련 모델과 훈련 스크립트를 오픈소스로 제공하여 재현 가능성과 커뮤니티의 도입을 촉진하기 위해.

제안 방법

  • 지식 정복을 통해 더 큰 교사 모델(BERT-base-ro 및 RoBERT-base)의 부드러운 레이블을 사용하여 더 작은 학생 모델을 훈련한다.
  • 세 개의 학생 모델을 생성한다: 각각의 교사 모델에서 개별적으로 유도한 모델과, 둘 다의 교사 모델을 조합한 앙상블에서 유도한 모델로, 병합된 훈련 코퍼스와 BERT-base-ro 토크나이저를 사용한다.
  • 정복 과정에서 교사와 학생의 로짓 간 교차 엔트로피 손실을 최소화하며, 부드러운 레이블 전달을 향상시키기 위해 온도 조정을 적용한다.
  • 예측 충실도는 세 가지 충실도 지표를 사용해 평가한다: 레이블 충실도(학생 예측이 교사 레이블과 일치하는 정확도), 확률 충실도(출력 분포 간 쿨백-라이블러 발산), 회귀 충실도(회귀 작업에 대한 피어슨 상관계수).
  • 추론 속도는 16에서 512 토큰까지의 시퀀스 길이에서 CPU 및 GPU에서 기준 모델과 비교하여 측정한다.
  • 모든 모델은 다섯 가지 루마니아어 NLP 작업에서 평가된다: 품사 태깅, 개별명칭 인식, 감성 분석, 당담어 식별, 의미적 텍스트 유사도.

실험 결과

연구 질문

  • RQ1지식 정복을 통해 루마니아어 BERT 모델을 효과적으로 압축하면서 다양한 NLP 작업에서 성능을 유지할 수 있는가?
  • RQ2다양한 루마니아어 BERT 교사 모델에서의 앙상블 정복은 단일 교사 정복에 비해 학생 모델의 성능과 일반화 능력에서 어떻게 다른가?
  • RQ3레이블, 확률, 회귀 충실도로 측정했을 때, 정련 모델이 교사 모델과 얼마나 높은 일관성을 유지하는가?
  • RQ4특히 GPU에서 정련 모델은 교사 모델보다 얼마나 더 빠른가?
  • RQ5정련 모델은 당담어 식별과 같은 특정 저자원 NLP 작업에서 교사 모델을 초월할 수 있는가?

주요 결과

  • Distil-BERT-base-ro는 당담어 식별에서 F1 점수 74.76%를 기록하여 앙상블 정련 모델보다 1.5% 높은 성능를 보였다.
  • DistilMulti-BERT-base-ro 모델은 교사 모델과 비교해 가장 높은 회귀 충실도(94.64%)를 기록하여 회귀 작업에서 출력 유사도가 매우 높다는 것을 시사했다.
  • 모든 정련 모델은 GPU에서 기준 모델 대비 약 35% 작고 두 배 빠른 성능를 보였으며, 특히 긴 시퀀스에서 뚜렷한 속도 향상이 있었다.
  • 평균적으로 모든 평가된 다섯 가지 작업에서 정련 모델은 기준 모델의 성능의 90% 이상을 유지했으며, 일부 작업에선 약간의 향상이 있었다.
  • 정련 모델은 감성 분석과 의미적 텍스트 유사도를 포함한 여러 작업에서 기준 모델과 다른 기준 모델보다 뛰어난 성능를 보였다.
  • GPU에서의 추론 속도는 기준 모델 대비 거의 두 배 빨라졌으며, 특히 긴 시퀀스에서 모든 모델 크기 중에서 가장 뛰어난 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.