[논문 리뷰] Random-LTD: Random and Layerwise Token Dropping Brings Efficient Training for Large-scale Transformers
Random-LTD는 중간 트랜스포머 레이어 전역에서 중요도 점수나 특수 토큰 처리 없이 무작위로 선택된 토큰을 건너뛰는 랜덤하고 계층 기반의 토큰 제거 방법을 제안한다. 이는 계산을 생략함으로써 중요도 점수나 특수 토큰 처리가 필요 없도록 하며, GPT-3 1.3B에서 유사한 제로샷 성능을 유지하면서 이론적으로 최대 33.3%의 계산량 감소와 25.6%의 월클록 트레이닝 시간 절감을 달성한다. 또한 수렴성을 향상시키고 튜닝 오버헤드를 줄이기 위해 새로운 LayerToken 기반 학습률 스케줄링 방식을 도입한다.
Large-scale transformer models have become the de-facto architectures for various machine learning applications, e.g., CV and NLP. However, those large models also introduce prohibitive training costs. To mitigate this issue, we propose a novel random and layerwise token dropping method (random-LTD), which skips the computation of a subset of the input tokens at all middle layers. Particularly, random-LTD achieves considerable speedups and comparable accuracy as the standard training baseline. Compared to other token dropping methods, random-LTD does not require (1) any importance score-based metrics, (2) any special token treatment (e.g., [CLS]), and (3) many layers in full sequence length training except the first and the last layers. Besides, a new LayerToken learning rate schedule is proposed for pretraining problems that resolve the heavy tuning requirement for our proposed training mechanism. Finally, we demonstrate that random-LTD can be applied to broader applications, including GPT and BERT pretraining as well as ViT and GPT finetuning tasks. Our results show that random-LTD can save about 33.3% theoretical compute cost and 25.6% wall-clock training time while achieving similar zero-shot evaluations on GPT-31.3B as compared to baseline.
연구 동기 및 목표
- 대규모 트랜스포머의 NLP 및 비전 응용 분야에서 높은 트레이닝 비용을 줄이기 위해.
- 토큰 제거 방법에서 중요도 점수나 특수 토큰 처리(예: [CLS])에 의존하지 않도록 하기 위해.
- 모든 중간 레이어에 걸쳐 토큰 제거를 적용하여 효율성을 극대화하기 위해.
- 새로운 LayerToken 기반 학습률 스케줄링을 통해 하이퍼파rameter 튜닝 부담을 줄이기 위해.
- BERT, GPT, ViT의 다양한 작업, 즉 사전학습 및 미세조정을 포함한 검증을 위해.
제안 방법
- Random-LTD는 중요도 점수나 특수 토큰 보존 없이 각 중간 트랜스포머 레이어에서 무작위로 토큰을 제거한다.
- 각 레이어는 독립적으로 토큰을 제거하여 층 간 attention 의존성을 유지하고 전체 시퀀스 길이의 병목 현상을 방지한다.
- 자기회귀 모델에서 기울기 노이즈를 줄이고 트레이닝-인퍼런스 갭을 줄이기 위해 단조적 시퀀스 길이 증가 스케줄링을 도입한다.
- 누적된 토큰 소비량에 따라 학습률을 조정하는 새로운 LayerToken 기반 학습률 스케줄링을 통해 수렴성을 향상시킨다.
- 사전학습 및 미세조정 모두에서 BERT, GPT, ViT 아키텍처에 동일하게 적용된다.
- 이 방법은 정규화 효과를 가지며, 드롭아웃과 함께 사용하거나 대체할 경우 성능 향상을 보인다.
실험 결과
연구 질문
- RQ1중요도 점수나 특수 토큰 처리에 의존하지 않고도 랜덤하고 계층 기반의 토큰 제거가 의미 있는 트레이닝 효율성 향상을 이룰 수 있는가?
- RQ2다양한 아키텍처에서 기준 트레이닝 대비 계산 비용, 월클록 시간, 모델 정확도 측면에서 Random-LTD는 어떻게 비교되는가?
- RQ3LayerToken 기반 학습률 스케줄링이 Random-LTD 트레이닝에서 튜닝 노력 감소와 수렴성 향상에 효과적으로 기여하는가?
- RQ4Random-LTD는 사전학습 및 미세조정에서 모델 일반화 능력을 향상시키는 정규화 효과를 보이는가?
- RQ5Random-LTD는 인과적 언어 모델 및 비전 트랜스포머를 포함한 다양한 트랜스포머 아키텍처와 작업으로 일반화 가능한가?
주요 결과
- Random-LTD는 GPT-3 1.3B에서 이론적 계산 비용을 최대 33.3% 감소시키고 월클록 트레이닝 시간을 최대 25.6% 절감하면서도 유사한 제로샷 평가 성능을 유지한다.
- LayerToken 학습률 스케줄링을 사용할 경우 기준 모델과 유사한 검증 손실을 달성하며, Random-LTD 트레이닝에서 표준 학습률 스케줄링보다 우수한 성능을 보인다.
- BERT 라지 사전학습에서 드롭아웃 없이 Random-LTD를 사용할 경우 RACE-m에서 표준 기준보다 >1% 높은 정확도를 기록하여 정규화 효과를 시사한다.
- GPT-3 1.3B에서 2880B LayerTokens를 사용한 Random-LTD는 4320B LayerTokens를 사용한 기준 모델과 유사한 성능을 달성하여 자원 활용 효율성이 뛰어나다는 것을 보여준다.
- LayerToken 학습률 스케줄링은 각 레이어의 토큰 소비량에 따라 학습률을 조정함으로써 특히 후반 트레이닝 단계에서 수렴성을 크게 향상시킨다.
- Random-LTD는 BERT 및 GPT 사전학습, ViT 미세조정을 포함한 다양한 작업에서 일관된 성능 향상을 보이며, 광범위한 적용 가능성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.