Skip to main content
QUICK REVIEW

[논문 리뷰] What Language Model to Train if You Have One Million GPU Hours?

Teven Le Scao, Thomas J. Wang|arXiv (Cornell University)|2022. 10. 27.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 고정된 100만 A100-GPU 시간 예산 내에서 1000억 개 이상의 파라미터를 가진 다국어 언어 모델에 대한 최적의 아키텍처와 훈련 선택을 조사한다. 13억 파라미터 규모에서의 추론 실험을 통해, The Pile와 같은 다양한 고품질 코퍼스에서의 사전 훈련이 제로샷 일반화 성능을 크게 향상시킨다는 점을 규명하였으며, 다국어 모델이 언어별로 고유한 스케일링 법칙을 보임을 확인하였다. 이를 바탕으로 1760억 파라미터의 BLOOM 아키텍처를 설계하였으며, 모든 모델과 코드는 허깅페이스에 공개되었다.

ABSTRACT

The crystallization of modeling methods around the Transformer architecture has been a boon for practitioners. Simple, well-motivated architectural variations can transfer across tasks and scale, increasing the impact of modeling research. However, with the emergence of state-of-the-art 100B+ parameters models, large language models are increasingly expensive to accurately design and train. Notably, it can be difficult to evaluate how modeling decisions may impact emergent capabilities, given that these capabilities arise mainly from sheer scale alone. In the process of building BLOOM--the Big Science Large Open-science Open-access Multilingual language model--our goal is to identify an architecture and training setup that makes the best use of our 1,000,000 A100-GPU-hours budget. Specifically, we perform an ablation study at the billion-parameter scale comparing different modeling practices and their impact on zero-shot generalization. In addition, we study the impact of various popular pre-training corpora on zero-shot generalization. We also study the performance of a multilingual model and how it compares to the English-only one. Finally, we consider the scaling behaviour of Transformers to choose the target model size, shape, and training setup. All our models and code are open-sourced at https://huggingface.co/bigscience .

연구 동기 및 목표

  • 고정된 100만 A100-GPU 시간 예산 내에서 1000억 개 이상의 파라미터를 가진 다국어 언어 모델에 대한 최적의 아키텍처와 훈련 설정을 결정하기 위해.
  • 13억 파라미터 규모에서 활성화 함수, 정규화, 위치 임베딩과 같은 아키텍처 구성 요소가 제로샷 일반화 성능에 미치는 영향을 평가하기 위해.
  • 사전 훈련 코퍼스의 다양성과 품질이 모델의 일반화 성능에 미치는 영향을 평가하기 위해.
  • 다국어 환경에서의 스케일링 행동을 연구하고 언어별로 고유한 스케일링 법칙을 규명하기 위해.
  • 체계적인 추론 및 스케일링 분석을 통해 최종 1760억 파라미터의 BLOOM 모델 설계를 이끌기 위해.

제안 방법

  • GPT-2 스타일의 디코더 전용 트랜스포머를 13억 파라미터 규모에서 제어된 추론 실험을 통해 활성화 함수, 정규화, 위치 임베딩 등의 아키텍처 구성 요소를 평가하기 위해.
  • EAI Harness 스위트를 사용하여 20개의 다양한 NLP 벤치마크에서의 제로샷 일반화 성능을 평가하기 위해.
  • The Pile, C4, OSCAR v1와 같은 다양한 코퍼스에서의 사전 훈련을 비교하여 데이터 구성이 모델 성능에 미치는 영향을 규명하기 위해.
  • 영어 전용 모델과 다국어 모델을 각각 훈련시켜 성능을 언어별로 측정함으로써 다국어 스케일링 행동을 분석하기 위해.
  • 최종 1760억 파라미터 모델의 최적 모델 크기와 사전 훈련 토큰 수를 추정하기 위해 파워 법칙 스케일링 피팅(αC ≈ 0.046)을 사용하기 위해.

실험 결과

연구 질문

  • RQ113억 파라미터 모델에서 가장 높은 제로샷 일반화 성능를 보이는 사전 훈련 코퍼스는 무엇인가요?
  • RQ2활성화 함수, 정규화, 위치 임베딩과 같은 아키텍처 구성 요소가 제로샷 일반화에 미치는 영향은 무엇인가요?
  • RQ3다국어성은 모델의 스케일링 행동과 성능에 어떤 영향을 미치나요?
  • RQ4영어 전용 모델과 다국어 모델 간의 스케일링 법칙은 어떻게 다릅니까?
  • RQ5고정된 100만 A100-GPU 시간 예산 내에서 성능을 극대화하기 위한 최적의 모델 크기와 사전 훈련 데이터 스케일은 무엇인가요?

주요 결과

  • 다양하고 고품질의 코퍼스인 The Pile에서 사전 훈련한 13억 파라미터 모델가 가장 높은 제로샷 일반화 정확도(47.09%)를 기록했으며, C4와 OSCAR v1를 초월하였다.
  • The Pile에서 훈련한 다국어 모델가 제로샷 일반화 정확도 47.09%를 기록했으며, 동일한 코퍼스에서 훈련된 영어 전용 베이스라인에 비해 뚜렷한 성능 향상을 보였다.
  • 이 연구에서는 다국어 모델가 언어별로 고유한 스케일링 법칙을 보이며, 사전 훈련 데이터 분포에 따라 성능이 언어 간으로 다양하게 변동됨을 발견하였다.
  • 파워 법칙 스케일링 계수 αC ≈ 0.046가 관찰되어, 최종 1760억 파라미터의 BLOOM 모델에 대한 최적의 모델 크기와 사전 훈련 데이터 스케일을 정확하게 추정할 수 있었다.
  • GELU 활성화 함수, RMSNorm, 로테이션 위치 임베딩과 같은 아키텍처 선택이 성능 향상에 기여하였으며, 특히 RMSNorm이 일반화 성능 향상에 뚜렷한 기여를 하였다.
  • 최종 BLOOM 모델는 이러한 발견들을 바탕으로 설계되었으며, 모든 모델, 코드, 미팅 노트가 허깅페이스에 공개되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.