[논문 리뷰] On the Transformer Growth for Progressive BERT Training
이 논문은 복합 스케일링을 통해 점진적인 BERT 사전학습을 위한 CompoundGrow를 제안한다. 이는 최적화된 성장 연산자를 사용하여 깊이, 너비, 입력 시퀀스 길이의 다중 차원을 동시에 균형 있게 확장하는 방법이다. 깊이, 너비, 길이의 다중 차원을 균형 있게 조절하고, 길이에 대해서는 임bedding 풀링, 너비에 대해서는 파라미터 공유와 같은 효과적인 연산자를 선택함으로써, BERT-base와 BERT-large의 사전학습을 각각 벽면 시간 기준으로 73.6%와 82.2% 가속화했으며, 원래 BERT 성능을 유지하거나 초월하였다.
Due to the excessive cost of large-scale language model pre-training, considerable efforts have been made to train BERT progressively -- start from an inferior but low-cost model and gradually grow the model to increase the computational complexity. Our objective is to advance the understanding of Transformer growth and discover principles that guide progressive training. First, we find that similar to network architecture search, Transformer growth also favors compound scaling. Specifically, while existing methods only conduct network growth in a single dimension, we observe that it is beneficial to use compound growth operators and balance multiple dimensions (e.g., depth, width, and input length of the model). Moreover, we explore alternative growth operators in each dimension via controlled comparison to give operator selection practical guidance. In light of our analyses, the proposed method speeds up BERT pre-training by 73.6% and 82.2% for the base and large models respectively, while achieving comparable performances
연구 동기 및 목표
- 점진적 사전학습에서 트랜스포저 성장에 대한 이해를 심화하고, 특히 다차원 스케일링의 역할을 규명한다.
- BERT 모델의 깊이, 너비, 입력 길이 차원에서 효과적인 성장 연산자를 규명한다.
- 효율적인 복합 성장 전략을 통해 대규모 BERT 사전학습의 높은 계산 비용을 줄인다.
- 점진적 학습에서 성장 연산자에 대한 실용적이고 경험 기반의 설계 원칙을 제공한다.
제안 방법
- 깊이, 너비, 입력 시퀀스 길이를 균형 있게 동시에 스케일링하는 복합 성장 연산자를 제안한다.
- 길이 차원에서 길이 2의 임베딩 풀링을 적용하여 장기 시퀀스의 직접적인 잘라내기를 대체한다.
- 피드포워드 네트워크에 k=2로 파라미터 공유를 적용하여, 완전한 재초기화 없이도 너비를 효율적으로 확장한다.
- 작은 모델에서 스택킹을 통해 깊이를 증가시키며, 학습된 가중치를 유지한다.
- 다양한 차원에서 성장 연산자를 비교하기 위해 통제된 아블레이션 연구를 수행한다. 이는 저랭크 근사와 풀링을 포함한다.
- 세 단계의 학습 스케줄을 구현한다: 부분 용량으로 작은 모델을 학습한 후, 전체 용량으로 복합 성장을 적용하고, 마지막으로 전체 미세조정을 수행한다.
실험 결과
연구 질문
- RQ1깊이, 너비, 입력 길이의 다중 차원에서 복합 스케일링이 단일 차원 성장보다 더 나은 성능과 빠른 학습을 이끌어내는가?
- RQ2길이 차원에서는 풀링 대비 잘라내기, 너비 차원에서는 파라미터 공유 대비 저랭크 근사 등 각 차원에서 가장 효과적인 성장 연산자는 무엇인가?
- RQ3복합 성장 전략가 성능을 표준 BERT 사전학습과 유사하거나 뛰어나게 유지하면서 훨씬 더 짧은 학습 시간을 확보할 수 있는가?
- RQ4성장 연산자의 선택이 학습 안정성과 최종 미세조정 성능에 어떤 영향을 미치는가?
주요 결과
- CompoundGrow는 표준 학습 대비 BERT-base 사전학습 벽면 시간을 73.6% 감소시키고, BERT-large는 82.2% 감소시켰으며, 성능 저하 없이 수행되었다.
- GLUE 벤치마크에서 표준 BERT와 유사하거나 더 좋은 성능을 달성했으며, CoLA에서는 다소 낮은 성능을 보였는데, 이는 데이터셋 크기와 변동성 때문일 가능성이 높다.
- 임베딩 풀링은 직접적인 잘라내기보다 길이 성장에서 더 뛰어난 성능을 보였으며, 일반화 능력과 학습 안정성을 향상시켰다.
- 파라미터 공유가 저랭크 근사보다 너비 스케일링에서 더 효과적이었으며, 모델 용량과 성능을 유지했다.
- 깊이, 너비, 입력 길이에 걸쳐 복합 스케일링을 적용할 경우 단일 차원 성장보다 열등한 결과를 얻었으며, 점진적 학습에서 복합 효과를 입증했다.
- 최종 모델은 MNLI 및 SQuaD 벤치마크에서 표준 BERT 성능을 유지하거나 초월했으며, 복합 성장 전략의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.