Skip to main content
QUICK REVIEW

[논문 리뷰] Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models

Jupinder Parmar, Sanjev Satheesh|arXiv (Cornell University)|2024. 07. 09.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델의 계속된 미세조정을 위한 실용적인 조리법을 제안하며, 기존 모델을 재사용함으로써 다시 시작부터 재학습하는 것을 피하고자 한다. 데이터 분포의 변화와 학습률 스케줄링을 최적화함으로써 — 특히 지식 집약적인 작업을 우선시하는 이단계 데이터 블렌딩과 조기 웜업이 있는 코스인 감쇠 스케줄링을 사용함으로써 — 기존의 계속된 미세조정 대비 MMLU에서 평균 정확도를 9% 향상시켰으며, 전체 재학습 없이도 모델 향상에 있어 뚜렷한 효율성 향상을 입증한다.

ABSTRACT

As language models have scaled both their number of parameters and pretraining dataset sizes, the computational cost for pretraining has become intractable except for the most well-resourced teams. This increasing cost makes it ever more important to be able to reuse a model after it has completed pretraining; allowing for a model's abilities to further improve without needing to train from scratch. In this work, we detail a set of guidelines that cover how to design efficacious data distributions and learning rate schedules for continued pretraining of language models. When applying these findings within a continued pretraining run on top of a well-trained 15B parameter model, we show an improvement of 9\% in average model accuracy compared to the baseline of continued training on the pretraining set. The resulting recipe provides a practical starting point with which to begin developing language models through reuse rather than retraining.

연구 동기 및 목표

  • 대규모 언어 모델의 사전 훈련에 따른 증가하는 계산 비용을 해결하기 위해, 이미 훈련된 모델의 효과적인 재사용을 가능하게 하기 위해.
  • 기존 능력을 해치지 않으면서 모델 능력을 향상시키는 데 최적의 데이터 분포 전략을 규명하기 위해.
  • 계속된 미세조정 동안 학습 속도와 모델 안정성의 균형을 이루는 효과적인 학습률 스케줄링을 규명하기 위해.
  • 일반 목적의 언어 모델 능력을 계속된 미세조정을 통해 향상시키기 위한 이식 가능하고 실용적인 조리법을 제공하기 위해.

제안 방법

  • 이중 단계 데이터 분포 설계: 첫 번째로 원래의 사전 훈련 데이터 분포에서 계속된 미세조정을 수행하고, 두 번째로 지식 집약적이고 작업 중심의 데이터(예: QA 데이터셋)를 강조하는 이동된 분포를 적용한다.
  • 성능 저하를 방지하기 위해 학습 강도와 감쇠의 급격함을 균형 잡는 코스인 감쇠 스케줄링과 함께 조기 웜업을 구현한다.
  • 계속된 미세조정 토큰 수 300B 지점에서 데이터 분포 전환 지점을 설정하여, 사전 훈련 데이터에서 작업 중심 데이터로의 전환을 유도한다.
  • E5-large-v2 임베딩과 FAISS를 사용하여 QA 예제와 가장 유사한 50개의 비-QA 문서를 추출함으로써 장기적인 수평 미세조정에서의 데이터 유용성을 향상시킨다.
  • 모델 규모에 관계없이 결과의 일반화를 확보하기 위해 8T 토큰으로 사전 훈련된 15B 파라미터 모델을 기반 모델로 사용한다.
  • 계속된 미세조정 토큰 수가 다양할 경우(100B에서 1T 토큰까지) MMLU 및 각 작업별 벤치마크에서 성능을 평가한다.
Figure 1: Breakdown of the various distributions considered for the General Blend (GB). We use Upweight Non Web w/ High Quality Web as the GB moving forward given its strong performance across all evaluation areas.
Figure 1: Breakdown of the various distributions considered for the General Blend (GB). We use Upweight Non Web w/ High Quality Web as the GB moving forward given its strong performance across all evaluation areas.

실험 결과

연구 질문

  • RQ1기존 능력을 악화시키지 않으면서 계속된 미세조정에서 성능 향상을 극대화하는 데 최적의 데이터 분포 전략은 무엇인가?
  • RQ2계속된 미세조정 동안 가장 효율적이고 안정적인 학습을 가능하게 하는 학습률 스케줄링은 무엇인가?
  • RQ3학습 과정에서 데이터 분포를 전환할 적절한 시점은 언제인가?
  • RQ4기존 사전 훈련 데이터에서 문서 마이닝을 통해 QA 유사 문서를 추출하면 장기적인 수평 미세조정에서 모델 정확도 향상에 기여하는가?

주요 결과

  • 제안된 조리법은 원래의 사전 훈련 분포에서의 계속된 미세조정 대비 MMLU 평균 정확도를 9% 향상시켰으며(56.1에서 54.6으로), 최고 성능는 56.1을 기록했다.
  • 계속된 미세조정 토큰 수 300B 지점에서 데이터 분포를 전환할 경우 가장 높은 성능를 기록했으며, 이는 이른 시점이나 늦은 시점의 전환보다 뛰어났다.
  • 최대 학습률의 1/10 수준에서 조기 웜업을 적용한 코스인 감쇠 스케줄링을 사용할 경우 가장 효과적인 학습 역학을 확보했다.
  • 이 조리법은 다양한 훈련 수평에서 일관되게 성능 향상을 이끌었으며, 계속된 미세조정 토큰 수 1T일 경우 기준 모델 대비 16%의 정확도 향상을 달성했다.
  • 사전 훈련 데이터에서 QA 유사 문서를 마이닝하여 추출함으로써 MMLU에서 정확도를 56.8%에서 57.9%로 향상시켰으며, 이는 데이터 유용성 향상을 입증한다.
  • 이 조리법은 100B에서 1T 토큰까지 광범위한 계속된 미세조정 스케일에서 강력하고 효과적으로 작동하며, 높은 이식 가능성과 견고함을 보였다.
Figure 2: Various distributions of QA data. We use Blend 3.
Figure 2: Various distributions of QA data. We use Blend 3.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.