[논문 리뷰] A Short Study on Compressing Decoder-Based Language Models
이 논문은 레이어 잘라내기와 데이터 정제를 사용하여 초기부터 교육된 소규모 GPT-2 모델을 통해 디코더 기반 언어 모델을 시간 효율적으로 압축하는 방법을 제안한다. 지식 정제 기반의 DistilGPT-2보다도 더 낮은 훈련 시간에도 불구하고 다운스트림 작업에서 더 뛰어난 성능을 보였다. 또한 의사균일 잘라내기 전략을 도입하였으며, 데이터 정제가 효율성과 성능을 모두 향상시킨다는 것을 입증하였다.
Pre-trained Language Models (PLMs) have been successful for a wide range of natural language processing (NLP) tasks. The state-of-the-art of PLMs, however, are extremely large to be used on edge devices. As a result, the topic of model compression has attracted increasing attention in the NLP community. Most of the existing works focus on compressing encoder-based models (tiny-BERT, distilBERT, distilRoBERTa, etc), however, to the best of our knowledge, the compression of decoder-based models (such as GPT-2) has not been investigated much. Our paper aims to fill this gap. Specifically, we explore two directions: 1) we employ current state-of-the-art knowledge distillation techniques to improve fine-tuning of DistilGPT-2. 2) we pre-train a compressed GPT-2 model using layer truncation and compare it against the distillation-based method (DistilGPT2). The training time of our compressed model is significantly less than DistilGPT-2, but it can achieve better performance when fine-tuned on downstream tasks. We also demonstrate the impact of data cleaning on model performance.
연구 동기 및 목표
- BERT와 같은 인코더 기반 모델에 비해 덜 연구된 디코더 기반 모델(GPT-2 등)의 압축에 관한 연구 부족 문제를 해결하기 위해.
- 최신 지식 정제 및 교사 없는 기법을 활용하여 DistilGPT-2의 피지컬 훈련 성능을 향상시키기 위해.
- 더 큰 교사 모델에서 더 작은 GPT-2 모델을 초기화하기 위한 레이어 잘라내기 방법을 탐색하여 더 빠른 사전 훈련을 목표로 하기 위해.
- 데이터 정제가 사전 훈련 효율성과 다운스트림 성능에 미치는 영향을 평가하기 위해.
- 지식 정제 없이 사전 훈련된 압축된 GPT-2 모델이 다운스트림 작업에서 DistilGPT-2를 능가할 수 있는지 보여주기 위해.
제안 방법
- 12층의 GPT-2-xl 교사 모델에서 유사 균일 레이어 잘라내기를 사용하여 6층의 GPT-2 학생 모델을 사전 훈련한다.
- HTML, 짧은 문장, 알파벳과 숫자 외의 노이즈, 중복 항목을 제거하여 OpenWebText 데이터셋을 정제하여 데이터셋 크기를 65.5% 감소시킨다.
- 교사 모델의 파라미터를 레이어 간에 균일하게 분배하는 의사균일 초기화 전략을 사용한다.
- 피지컬 훈련을 위한 지식 정제 기법(Annealing-KD, MATE-KD, RAIL-KD)을 평가한다.
- Zero-shot 및 피지컬 훈련된 퍼플렉서티와 정확도 점수를 사용하여 Wikitext103 및 SuperGLUE 벤치마크에서 성능을 평가한다.
- 지식 정제를 사용하거나 사용하지 않아도 사전 훈련된 모델 간의 훈련 시간과 성능을 비교한다.
실험 결과
연구 질문
- RQ1지식 정제 기법이 다운스트림 NLP 작업에서 DistilGPT-2의 피지컬 훈련 성능을 향상시킬 수 있는가?
- RQ2레이어 잘라내기를 사용하여 초기부터 압축된 GPT-2 모델을 사전 훈련하면, 다운스트림 성능과 훈련 효율성 측면에서 DistilGPT-2를 능가할 수 있는가?
- RQ3OpenWebText 데이터셋의 데이터 정제가 사전 훈련 시간과 최종 모델 성능에 어떤 영향을 미치는가?
- RQ4어느 레이어 잘라내기 전략이 더 큰 교사 모델에서 더 작은 GPT-2 모델을 초기화하는 데 가장 뛰어난 성능을 낼 수 있는가?
- RQ5지식 정제 없이 사전 훈련된 정제된 GPT-2 모델이 DistilGPT-2를 뛰어넘는 성능을 달성할 수 있는가?
주요 결과
- 의사균일 잘라내기와 정제된 데이터를 사용하여 사전 훈련된 모델은 피지컬 훈련 후 Wikitext103에서 테스트 퍼플렉서티 22.42를 기록하여, Zero-shot 상태에서 DistilGPT-2의 21.13보다 떨어지지만 훨씬 적은 훈련 시간을 소비하였다.
- 정제된 OpenWebText 데이터셋을 사용한 사전 훈련은 훈련 시간을 42시간(비교적 DistilGPT-2의 768시간 대비)으로 줄였으며, 7개의 다운스트림 작업 중 5개에서 유사하거나 더 뛰어난 성능을 기록하였다.
- 의사균일 잘라내기 전략은 다른 초기화 방법보다 뛰어난 성능을 보였으며, Wikitext103에서 45.93의 Zero-shot 퍼플렉서티를 기록하여 DistilGPT-2의 45.26에 근접하였다.
- 데이터 정제로 인해 OpenWebText 데이터셋 크기가 33200만 건에서 11400만 건으로 감소하여 사전 훈련 시간이 94% 감소했으며, 성능은 유지되거나 향상되었다.
- 정제된 데이터셋의 10%만을 사용하여 사전 훈련한 모델도 피지컬 훈련 퍼플렉서티 22.42를 기록하여, 교사 모델의 파라미터 수의 약 1/3에 불과한데도 불구하고 DistilGPT-2의 21.13과 유사한 성능을 보였다.
- SuperGLUE 벤치마크에서 정제된 데이터로 사전 훈련된 모델은 7개 작업 중 5개에서 최신 기술 수준 성능을 기록하였으며, BoolQ에서 77.64%의 정확도와 WSC에서 73.74%의 정확도를 기록하여 대부분의 경우 DistilGPT-2를 능가하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.