[논문 리뷰] DeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing
이 논문은 깊이 학습 모델 훈련을 향상시키기 위해 효율적인 데이터 샘플링을 위한 확장 가능한 커리큘럼 학습과 새로운 랜덤 계층별 토큰 제거(random-LTD) 기법을 결합한 DeepSpeed Data Efficiency 프레임워크를 소개한다. 이는 GPT-3 1.3B 미리 훈련에서 기준 모델 품질의 95%를 유지하면서도 Azure에서 최대 12.5배의 데이터, 시간, 비용 절감(최저 $3.7K)을 달성한다.
Recent advances on deep learning models come at the price of formidable training cost. The increasing model size is one of the root causes, but another less-emphasized fact is that data scale is actually increasing at a similar speed as model scale, and the training cost is proportional to both of them. Compared to the rapidly evolving model architecture, how to efficiently use the training data (especially for the expensive foundation model pretraining) is both less explored and difficult to realize due to the lack of a convenient framework that focuses on data efficiency capabilities. To this end, we present DeepSpeed Data Efficiency, a framework that makes better use of data, increases training efficiency, and improves model quality. Specifically, we propose and combine two data efficiency techniques: efficient data sampling via a general curriculum learning library, and efficient data routing via a novel random layerwise token dropping technique. For GPT-3 1.3B language model pretraining, our work achieves 12.5x less data/time/cost (\$3.7K if rent on Azure), while still maintaining 95% of model quality compared to baseline with full data and cost (\$46.3K). For GPT-3 1.3B and BERT-large pretraining, our work can also achieve the same model quality with up to 2x less data/time/cost, or achieve better model quality under same data/time/cost. DeepSpeed Data Efficiency is easy to use and tune, enabling us to easily apply it and verify its benefit on additional tasks including GPT-3 MoE model pretraining and small-scale GPT-2/ViT finetuning.
연구 동기 및 목표
- 모델과 데이터 스케일의 증가로 인한 대규모 딥러닝 훈련 비용 증가 문제를 해결하기 위해.
- 기존 데이터 효율 기법의 한계, 즉 확장성 부족, 맞춤형 설정 불가, 훈련 파이프라인과의 호환성 부족 문제를 해결하기 위해.
- 사전 훈련 및 피지테이닝 동안 NLP 및 비전 모델 모두에 대해 데이터 샘플링과 라우팅을 향상시키는 통합적이고 확장 가능한 프레임워크를 개발하기 위해.
- 특히 기초 모델 사전 훈련을 위한 막대한 데이터, 시간, 비용 절감을 달성하면서도 모델 품질을 손상시키지 않기 위해.
- 사용자 친화적이고 PyTorch 호환성 있는 도구 세트를 제공하여 데이터 효율 전략의 간편한 통합과 튜닝을 가능하게 하기 위해.
제안 방법
- 대규모 데이터셋에서 확장 가능한 메트릭 기반 데이터 분석 및 인덱싱을 위한 맵-리듀스 기반 일반 커리큘럼 학습(CL) 라이브러리 도입.
- 다양한 난이도 메트릭과 훈련 전략을 지원하는 커스터마이징 가능한 CL 기반 데이터 샘플러 및 로더 구현.
- 각 트랜스포머 계층에서 일부 토큰의 계산을 건너뛰는 데이터 라우팅 기법인 랜덤 계층별 토큰 제거(random-LTD) 기법 제안.
- 특히 GPT와 같은 순차적 생성 모델에서 모델 안정성과 성능을 유지하기 위해 계층별 토큰 제거를 설계.
- 모델 손실에 기반해 토큰 제거를 동적으로 조정하는 MSLG(최소 샘플 손실 기울기) 전략 통합으로 훈련 효율성 향상.
- PyTorch 호환성 확보 및 GPT-3, BERT-large, ViT, MoE 아키텍처를 포함한 다양한 모델 지원.
실험 결과
연구 질문
- RQ1확장성과 일반화를 고려해 커리큘럼 학습을 대규모 사전 훈련에서 다양한 데이터 샘플링 전략을 지원할 수 있는가? 이는 철저한 코드 리팩터링 없이도 가능한가?
- RQ2random-LTD와 같은 데이터 라우팅 기법이 TokenBypass와 같은 기존 방법보다 훈련 효율성과 모델 품질 측면에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ3다양한 모델 아키텍처에서 데이터 효율 기법이 훈련 비용을 얼마나 줄일 수 있으며, 모델 성능을 유지하거나 향상시킬 수 있는가?
- RQ4데이터 샘플링과 라우팅 기법을 결합할 경우 실제 사전 훈련 환경에서 전체 훈련 효율성과 모델 품질에 어떤 영향을 미치는가?
- RQ5제안된 프레임워크가 MoE 모델 및 소규모 피지테이닝을 포함한 다양한 작업에 쉽게 확장되고 튜닝될 수 있는가?
주요 결과
- GPT-3 1.3B 사전 훈련에서 DeepSpeed Data Efficiency는 훈련 비용을 $46.3K에서 $3.7K로 12.5배 감소시키며 기준 모델 품질의 95%를 유지한다.
- GPT-3 1.3B 및 BERT-large 사전 훈련에서, 동일한 조건에서 최대 2배의 데이터, 시간, 비용 절감을 달성하거나 동일한 자원 제약 하에서 더 높은 성능을 달성한다.
- random-LTD는 모든 테스트 설정에서 TokenBypass를 능가한다: GPT-2 피지테이닝 및 GPT-3 350M 사전 훈련에서 동일한 토큰 절감 비율로 더 낮은 퍼플렉서티를 달성한다.
- MSLG 통합 시 random-LTD는 ViT 모델에서 1.3배의 훈련 속도 향상을 달성하며 약간의 정확도 향상을 보이며, EViT(1.15배 속도 향상)와 Peeling the Onion(1.15배 속도 향상)을 모두 능가한다.
- MoE 모델 사전 훈련 및 소규모 GPT-2/ViT 피지테이닝을 포함한 다양한 작업에서 일관된 성능 향상을 제공하며, 최소한의 튜닝 노력으로도 가능하다.
- 일반 커리큘럼 학습 라이브러리는 최소한의 파이프라인 수정으로도 확장 가능하고 커스터마이징 가능한 데이터 샘플링을 가능하게 하여 다양한 난이도 메트릭에 대한 빠른 실험을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.