Skip to main content
QUICK REVIEW

[논문 리뷰] GrowLength: Accelerating LLMs Pretraining by Progressively Growing Training Length

Hongye Jin, Xiaotian Han|arXiv (Cornell University)|2023. 10. 01.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Model, LLM)의 사전 훈련을 가속화하기 위해 훈련 중에 입력 시퀀스 길이를 128에서 4096 토큰으로 점진적으로 증가시키는 GrowLength이라는 방법을 제안한다. 짧은 시퀀스로 시작하여 점차 길이를 늘림으로써, 추가적인 공학 작업 없이도 훈련 효율성과 모델 성능을 향상시키며, 동일한 시간 내에 더 많은 토큰을 처리하고 고정 길이 기반 모델 대비 더 낮은 훈련 손실을 달성할 수 있다.

ABSTRACT

The evolving sophistication and intricacies of Large Language Models (LLMs) yield unprecedented advancements, yet they simultaneously demand considerable computational resources and incur significant costs. To alleviate these challenges, this paper introduces a novel, simple, and effective method named ``\growlength'' to accelerate the pretraining process of LLMs. Our method progressively increases the training length throughout the pretraining phase, thereby mitigating computational costs and enhancing efficiency. For instance, it begins with a sequence length of 128 and progressively extends to 4096. This approach enables models to process a larger number of tokens within limited time frames, potentially boosting their performance. In other words, the efficiency gain is derived from training with shorter sequences optimizing the utilization of resources. Our extensive experiments with various state-of-the-art LLMs have revealed that models trained using our method not only converge more swiftly but also exhibit superior performance metrics compared to those trained with existing methods. Furthermore, our method for LLMs pretraining acceleration does not require any additional engineering efforts, making it a practical solution in the realm of LLMs.

연구 동기 및 목표

  • 대규모 언어 모델의 사전 훈련에 소요되는 높은 계산 비용과 긴 훈련 시간을 해결하기 위해.
  • 사전 훈련 중에 동적 시퀀스 길이를 사용할 경우 훈련 효율성과 모델 성능 향상 여부를 탐색하기 위해.
  • 피너튜닝 단계에서 성공한 컨텍스트 창 크기 확장 기법을 사전 훈련 단계로 적용하기 위해.
  • 자원 활용도를 향상시키는 단순하고 효과적이며 즉시 사용 가능한 방법을 개발하기 위해.
  • 점진적으로 증가하는 시퀀스 길이로 훈련할 경우 더 빠른 수렴과 더 나은 일반화 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 이 방법은 사전 훈련 중에 입력 시퀀스 길이를 점진적으로 증가시키며, 처음에는 128 토큰에서 시작하여 시간이 지남에 따라 4096으로 증가시킨다.
  • 초기 단계에서 계산 처리량과 자원 활용도를 극대화하기 위해 짧은 시퀀스로 훈련을 시작한다.
  • 시퀀스 길이는 단계별로 증가한다(예: 128 → 256 → 512 → 1024 → 2048 → 4096), 이로써 모델이 점차 장거리 의존성을 학습할 수 있다.
  • 이 접근 방식은 양자화, 프루닝, FlashAttention와 같은 기존의 가속 기법과 수직적(orthogonal)이며, 이를 함께 사용할 수 있다.
  • 각 시퀀스 길이에 대해 훈련 비율은 히우리스틱적으로 선택되어 각 길이에서 투자하는 시간 비율을 제어한다.
  • 이 방법은 짧은 시퀀스가 계산적으로 더 저렴하며, 시퀀스 길이가 점차 증가하는 노출을 거친 후 모델이 더 긴 컨텍스트로 일반화할 수 있다는 통찰을 활용한다.

실험 결과

연구 질문

  • RQ1LLM 사전 훈련 중에 입력 시퀀스 길이를 점진적으로 늘리는 것이 훈련을 가속화하고 성능을 향상시킬 수 있는가?
  • RQ2먼저 짧은 시퀀스로 훈련하고 점차 길이를 늘리는 것이 더 나은 토큰 효율성과 더 빠른 수렴을 이끌어낼 수 있는가?
  • RQ3이 방법은 시퀀스 길이 증가 스케줄과 비율의 선택에 얼마나 민감한가?
  • RQ4동일한 훈련 시간 내에서 고정 길이 시퀀스 기반 훈련 대비 이 방법이 훈련 손실과 최종 성능 측면에서 뛰어나게 되는가?
  • RQ5GrowLength는 위치 외삽성(position extrapolation)과 장기 컨텍스트 일반화에 얼마나 기여하는가?

주요 결과

  • 동일한 기간 동안 훈련된 모델은 고정 길이 기반 모델(LangChain128 및 LLM1024 등)보다 GrowLength로 훈련한 모델이 더 낮은 훈련 손실을 기록한다.
  • 이 방법은 동일한 훈련 시간 내에 훨씬 더 많은 토큰을 처리할 수 있게 해 훈련 자원 효율성을 향상시킨다.
  • 수렴 속도와 최종 성능 측면에서 GrowLength는 짧은 시퀀스(128)와 긴 시퀀스(1024)를 사용한 고정 길이 기반 모델 모두를 능가한다.
  • 이 방법은 다양한 시퀀스 길이 증가 비율에 대해 강건하며, 256와 같은 중간 길이를 생략해도 성능 저하가 최소한이다.
  • 시퀀스 길이의 급격한 증가(예: 128에서 1024로)는 훈련 손실 급등과 성능 저하를 유발하며, 급격한 변화에 민감함을 보인다.
  • GrowLength는 입력 시퀀스 길이 관점에서 LLM 사전 훈련을 가속화하는 최초의 방법으로, 기존의 가속 기법과 호환되는 즉시 사용 가능한 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.