[논문 리뷰] bert2BERT: Towards Reusable Pretrained Language Models
이 논문은 대규모 언어 모델의 사전 훈련을 가속화하기 위해 작은 사전 훈련된 모델의 지식을 재사용하는 방법인 bert2BERT를 제안한다. 이는 고급 파라미터 초기화 및 이중 단계 훈련 전략을 통해 이루어지며, 특히 고급 지식 초기화(Advanced Knowledge Initialization, AKI)와 기능 유지 초기화(Function-Preserving Initialization, FPI)를 통해 작은 모델의 지식을 큰 모델에 초기화함으로써, GPT의 경우 최대 47%, BERT의 경우 최대 45%의 사전 훈련 계산량을 절감한다. 이는 다양한 아키텍처에서 뛰어난 효율성 향상을 보여준다.
In recent years, researchers tend to pre-train ever-larger language models to explore the upper limit of deep models. However, large language model pre-training costs intensive computational resources and most of the models are trained from scratch without reusing the existing pre-trained models, which is wasteful. In this paper, we propose bert2BERT, which can effectively transfer the knowledge of an existing smaller pre-trained model (e.g., BERT_BASE) to a large model (e.g., BERT_LARGE) through parameter initialization and significantly improve the pre-training efficiency of the large model. Specifically, we extend the previous function-preserving on Transformer-based language model, and further improve it by proposing advanced knowledge for large model's initialization. In addition, a two-stage pre-training method is proposed to further accelerate the training process. We did extensive experiments on representative PLMs (e.g., BERT and GPT) and demonstrate that (1) our method can save a significant amount of training cost compared with baselines including learning from scratch, StackBERT and MSLT; (2) our method is generic and applicable to different types of pre-trained models. In particular, bert2BERT saves about 45% and 47% computational cost of pre-training BERT_BASE and GPT_BASE by reusing the models of almost their half sizes. The source code will be publicly available upon publication.
연구 동기 및 목표
- 대규모 언어 모델의 사전 훈련에 따른 높은 계산 비용과 탄소 배출량을 줄이기 위해.
- 초기 훈련에서부터가 아니라 기존에 훈련된 작은 모델의 지식을 재사용함으로써 효율적인 사전 훈련을 탐색하기 위해.
- BERT나 GPT와 같은 다양한 트랜스포머 기반 사전 훈련된 모델에 적용 가능한 일반적이고 모델에 종속되지 않는 방법을 개발하기 위해.
- 파라미터 초기화 및 이중 단계 사전 훈련 전략을 통해 훈련 효율성을 향상시키기 위해.
제안 방법
- Chen 등(2016)의 기능 유지 초기화(FPI)를 트랜스포머 기반 언어 모델로 확장하여, 초기화 시 큰 모델이 작은 모델과 유사하게 행동하도록 보장한다.
- 고급 지식 초기화(Advanced Knowledge Initialization, AKI)를 제안하며, 작은 모델의 다양한 레이어에서 얻은 가중치를 복제하고 스택하여 수렴 속도를 가속화한다. 이는 약간의 기능 유지 원칙 위반을 감수하더라도 가능하다.
- 최적화 속도를 더욱 향상시키기 위해 이중 단계 사전 훈련 전략을 적용한다.
- 작은 사전 훈련된 모델(예: D=512인 BERT BASE)의 파라미터를 복제하고 스택하여 더 큰 대상 모델(예: D=768인 BERT LARGE)을 초기화한다.
- 이 방법을 BERT 및 GPT 아키텍처 모두에 적용하여, 다양한 모델 유형과 정규화 방식(예: 후행 정규화(post-LN) 대 후행 정규화(pre-LN))에 걸쳐 일반적인 적용 가능성을 입증한다.
- 초기화된 큰 모델에 표준 사전 훈련 목표(마스크 언어 모델링 및 다음 문장 예측)를 적용하고, 최적화된 초모수를 사용하여 더 빠른 수렴을 달성한다.
실험 결과
연구 질문
- RQ1작은 사전 훈련된 모델의 지식을 효과적으로 큰 모델에 전이하여 사전 훈련 비용을 줄일 수 있는가?
- RQ2고급 지식 초기화(AKI)가 큰 모델 사전 훈련 중 수렴 속도를 높이기 위해 표준 기능 유지 초기화보다 우수한가?
- RQ3제안된 방법이 BERT 및 GPT와 같은 다양한 아키텍처에서 계산 비용 절감에 얼마나 기여하는가?
- RQ4이 방법은 후행 정규화(post-LN) 대 후행 정규화(pre-LN)와 같은 다양한 정규화 방식을 가진 다양한 사전 훈련된 모델에 적용 가능한가?
- RQ5이중 단계 사전 훈련 전략은 초기화된 가중치로부터 직접 훈련하는 것과 비교해 훈련 효율성을 어떻게 향상시키는가?
주요 결과
- 작은 모델(약 반 키스의 크기)에서 초기화할 경우, BERT BASE의 경우 사전 훈련 계산 비용을 45% 절감하고, GPT BASE의 경우 47% 절감한다.
- 이 방법은 BERT(post-LN)와 GPT(pre-LN)와 같은 다양한 모델 아키텍처에서 뚜렷한 효율성 향상을 보이며, 일반적인 적용 가능성의 타당성을 입증한다.
- 고급 지식 초기화(AKI)는 기능 유지 원칙을 약간 위반하지만, 표준 기능 유지 초기화보다 더 빠른 수렴을 이끈다.
- 이중 단계 사전 훈련 전략은 훈련을 더욱 가속화하며, 전체적인 효율성 향상에 기여한다.
- StackBERT 및 MSLT와 같은 베이스라인에 비해 계산 비용 절감 측면에서 뛰어나며, 하류 작업에서 경쟁 가능한 성능 유지를 유지한다.
- 실험 결과, 작은 모델과 큰 모델 간의 어텐션 패턴이 매우 유사함을 확인하여, 서로 다른 크기의 모델 간 지식 전이의 타당성을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.