Skip to main content
QUICK REVIEW

[논문 리뷰] One Epoch Is All You Need

Aran Komatsuzaki|arXiv (Cornell University)|2019. 06. 16.
Topic Modeling참고 문헌 16인용 수 19
한 줄 요약

이 논문은 제안된 히우리스틱을 통해 모델 크기와 학습 반복 횟수를 조정하면서, 훨씬 더 큰 데이터셋에서 유supervised Transformer 언어 모델을 오직 한 에포크 동안만 학습시키는 방법을 제안한다. 이 방법은 과적합 없이도 벽시계 시간 기준 3.3–5.1배의 속도 향상을 이끌어내며, 다중 에포크 학습을 능가하고, BERT나 GPT-2와 같은 모델의 학습 비용을 최대 10배까지 줄일 수 있는 길을 제시한다.

ABSTRACT

In unsupervised learning, collecting more data is not always a costly process unlike the training. For example, it is not hard to enlarge the 40GB WebText used for training GPT-2 by modifying its sampling methodology considering how many webpages there are in the Internet. On the other hand, given that training on this dataset already costs tens of thousands of dollars, training on a larger dataset naively is not cost-wise feasible. In this paper, we suggest to train on a larger dataset for only one epoch unlike the current practice, in which the unsupervised models are trained for from tens to hundreds of epochs. Furthermore, we suggest to adjust the model size and the number of iterations to be performed appropriately. We show that the performance of Transformer language model becomes dramatically improved in this way, especially if the original number of epochs is greater. For example, by replacing the training for 10 epochs with the one epoch training, this translates to 1.9-3.3x speedup in wall-clock time in our settings and more if the original number of epochs is greater. Under one epoch training, no overfitting occurs, and regularization method does nothing but slows down the training. Also, the curve of test loss over iterations follows power-law extensively. We compare the wall-clock time of the training of models with different parameter budget under one epoch training, and we show that size/iteration adjustment based on our proposed heuristics leads to 1-2.7x speedup in our cases. With the two methods combined, we achieve 3.3-5.1x speedup. Finally, we speculate various implications of one epoch training and size/iteration adjustment. In particular, based on our analysis we believe that we can reduce the cost to train the state-of-the-art models as BERT and GPT-2 dramatically, maybe even by the factor of 10.

연구 동기 및 목표

  • 대규모 언어 모델을 학습할 때의 높은 계산 비용, 특히 대규모 데이터셋에서의 다중 에포크 학습에 기인한 비용을 해결하기 위해.
  • 데이터셋 크기를 늘리고 에포크 수를 한 개로 줄였을 때 성능과 효율성이 향상되는지 조사하기 위해.
  • 한 에포크 학습에서 성능을 유지하거나 향상시키기 위해 모델 크기와 반복 횟수를 조정하는 히우리스틱을 개발하기 위해.
  • 데이터가 풍부한 비지도 학습 환경에서 수렴하기 위해 다중 에포크 학습이 반드시 필요하다는 통념을 도전하기 위해.
  • BERT나 GPT-2와 같은 최신 모델의 학습 비용을 이 방법을 통해 최대 10배까지 줄일 수 있는지 탐색하기 위해.

제안 방법

  • 더 많은 웹페이지를 느슨한 전략으로 인터넷에서 샘플링함으로써 학습 데이터셋 크기를 늘려, 한 에포크 동안 동일한 샘플이 반복되지 않도록 보장한다.
  • 과적합을 방지하지 못하면서도 학습 속도를 저하시키므로, 한 에포크 설정에서 과적합이 발생하지 않음을 확인한 후 모든 정규화 기법을 제거한다.
  • 계산 비용을 유지하기 위해 파rameter 예산과 시퀀스 길이를 균형 잡는 데 목적이 있는 제안된 히우리스틱을 사용해 모델 크기와 학습 반복 횟수를 조정한다.
  • 기존의 다중 에포크 학습과 동일한 총 파라미터 업데이트 횟수를 유지하면서, 확대된 데이터셋에서 정확히 한 에포크 동안 학습한다.
  • 학습 동역학을 분석하고 한 에포크 학습의 안정성을 검증하기 위해 반복 횟수에 따른 검증 손실에 대한 파워 법칙 피팅을 수행한다.
  • 더 많은 웹페이지를 포함하기 위한 데이터 샘플링 히우리스틱을 적용하고, 일부 손상된 샘플이 포함되더라도 그 영향을 필터링하거나 완화하는 방법을 탐색한다.

실험 결과

연구 질문

  • RQ1동일한 계산 비용 예산 내에서 더 큰 데이터셋에서 오직 한 에포크 동안 학습시키면 다중 에포크 학습보다 성능이 더 우수한가?
  • RQ2데이터셋이 충분히 크다면 한 에포크 학습에서 과적합이 발생하는가? 그리고 정규화 기법을 안전하게 제거할 수 있는가?
  • RQ3한 에포크 학습 조건에서 성능을 극대화하기 위해 모델 크기와 학습 반복 횟수 사이의 최적의 트레이드오프는 무엇인가?
  • RQ4한 에포크 학습에서 반복 횟수에 따른 검증 손실 곡선은 어떻게 행동하는가? 그리고 파워 법칙 분포를 따르는가?
  • RQ5이 방법을 사용해 BERT나 GPT-2와 같은 최신 모델의 학습 비용을 10배까지 줄일 수 있는가?

주요 결과

  • 데이터셋 확대와 적절한 크기/반복 횟수 조정을 통한 한 에포크 학습은 기존의 다중 에포크 학습 대비 벽시계 시간 기준 3.3–5.1배의 속도 향상을 이룬다.
  • 한 에포크 학습에서는 과적합이 발생하지 않으며, 정규화 기법은 효과가 없고 단지 학습 속도를 저하시킬 뿐이다.
  • 반복 횟수에 따른 검증 손실이 광범위하게 파워 법칙 분포를 따르며, 안정적이고 예측 가능한 학습 동역학을 나타낸다.
  • 특히 원래의 에포크 수가 높았을 경우(예: 10회 이상), Transformer 언어 모델의 성능이 한 에포크 학습에서 크게 향상된다.
  • 크기와 반복 횟수 조정을 위한 제안된 히우리스틱은 별도로 적용할 경우 1–2.7배의 속도 향상을 이끌어내며, 한 에포크 학습과 결합하면 저자들의 실험에서 3.3–5.1배의 속도 향상을 달성한다.
  • 저자들은 스케일링과 효율성 분석를 바탕으로, BERT나 GPT-2와 같은 모델의 학습 비용을 이 방법을 통해 최대 10배까지 줄일 수 있을 것이라 추측한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.