[논문 리뷰] Data-Juicer: A One-Stop Data Processing System for Large Language Models
Data-Juicer는 50개 이상의 조합 가능한 연산자를 통해 다양한 데이터 레시피의 효율적 구축, 평가 및 최적화를 가능하게 하는 통합형이고 확장 가능한 대규모 언어 모델(Large Language Models, LLMs)용 데이터 처리 시스템입니다. 이는 통합된 LLM 훈련 및 분산 컴퓨팅 생태계와 함께 확장성 있고 유연하며 자동 평가 기능을 갖춘 데이터 파이프라인 조합을 지원함으로써 16개의 LLM 벤치마크에서 평균 성능 향상 7.45%와 GPT-4 쌍대 평가에서 17.5% 높은 승리 비율을 달성합니다.
The immense evolution in Large Language Models (LLMs) has underscored the importance of massive, heterogeneous, and high-quality data. A data recipe is a mixture of data from different sources for training LLMs, which plays a vital role in LLMs' performance. Existing open-source tools for LLM data processing are mostly tailored for specific data recipes. To continuously uncover the potential of LLMs, incorporate data from new sources, and improve LLMs' performance, we build a new system named Data-Juicer, with which we can efficiently generate diverse data recipes, explore different possibilities in forming data mixtures, and evaluate their effects on model performance. Different from traditional data-analytics pipelines, Data-Juicer faces some unique challenges. Firstly, the possible data sources for forming data recipes are truly heterogeneous and massive with various qualities. Secondly, it is extremely expensive to precisely evaluate data recipes' impact on LLMs' performance. Thirdly, the end users of Data-Juicer, model developers, need sufficient flexibility to configure and evaluate different data recipes. Data-Juicer features a fine-grained abstraction of pipelines for constructing data recipes, with over 50 built-in operators for easy composition and extension. By incorporating visualization and auto-evaluation capabilities, Data-Juicer enables a timely feedback loop for both LLM pre-training and fine-tuning. Further, Data-Juicer is optimized and integrated with ecosystems for LLM training, evaluation, and distributed computing. The data recipes derived with Data-Juicer gain notable improvements on state-of-the-art LLMs, by up to 7.45% increase in averaged score across 16 LLM benchmarks and 17.5% higher win rate in pair-wise GPT-4 evaluations. Our system, data recipes, and tutorials are released, calling for broader data-centric research on training and understanding LLMs.
연구 동기 및 목표
- LLM 훈련 및 파인튜닝에서 이질적이고 고품질의 데이터 레시피를 처리하기 위한 민첩하고 확장 가능하며 확장 가능한 오픈소스 도구의 부족을 해결하기 위해.
- 모델을 재학습하지 않고도 즉각적인 피드백을 제공하기 위해 자동 평가 및 시각화를 통해 데이터 레시피 평가의 비용과 시간을 줄이기 위해.
- 사용자가 맞춤형 파이프라인을 통해 다양한 데이터 혼합물을 효율적으로 탐색할 수 있도록 지원하여 일반 목적 및 도메인 특화 작업에서 모델 성능을 향상시키기 위해.
- 데이터 처리 컴포onent을 분리함으로써 모듈성과 조합성을 향상시켜 LLM 훈련, 평가 및 분산 컴퓨팅 생태계와 원활하게 통합할 수 있도록 하기 위해.
제안 방법
- Data-Juicer는 데이터 정제, 필터링, 편집, 변환를 위한 50개 이상의 내장된 조합 가능한 연산자를 사용하여 데이터 처리 파이프라인에 대해 세분화된 추상화를 도입합니다.
- 사용자가 구성 가능한 하이퍼파rameter를 가진 연산자 조합을 통해 다양한 데이터 레시피를 맞춤형 파이프라인 설정을 통해 탐색할 수 있도록 허용합니다.
- 모델 재학습 없이도 데이터 레시피 영향을 즉각적으로 피드백할 수 있도록 자동 평가 및 시각화 기능을 통합합니다.
- Ray 및 Apache Beam과 같은 LLM 훈련, 평가 및 분산 컴퓨팅 프레임워크와 네이티브로 최적화되고 통합되어 있습니다.
- 다중 노드에서의 확장성 있는 데이터 처리를 지원하며, 분산 Ray 클러스터에서 처리 시간을 최대 87.4% 감소시켰습니다.
- 도메인 특화된 데이터 처리 능력을 맞춤형 연산자 조합을 통해 구현하여 금융, 독서 보조, 캐릭터 커스터마이제이션 등의 사용 사례에 적합하게 만들 수 있습니다.
실험 결과
연구 질문
- RQ1LLM 훈련 및 파인튜닝을 위한 다양한 이질적 데이터 소스를 지원하는 모듈화되고 조합 가능한 데이터 처리 시스템을 어떻게 설계할 수 있는가?
- RQ2다양한 데이터 레시피 조합이 LLM 성능에 미치는 영향은 무엇이며, 전체 모델 재학습 없이 이를 효율적으로 평가할 수 있는 방법은 무엇인가?
- RQ3대규모 스케일의 LLM 데이터 파이프라인을 위한 분산 데이터 처리에서 높은 확장성과 성능을 달성하기 위해선 어떻게 해야 하는가?
- RQ4통합된 데이터 처리 시스템이 여러 벤치마크와 실세계 응용 프로그램에서 모델 성능 향상에 얼마나 기여할 수 있는가?
- RQ5LLM용 데이터 레시피 개발에서 사용성, 맞춤형 설정 및 자동화를 어떻게 균형 있게 조절할 수 있는가?
주요 결과
- Data-Juicer는 16개의 표준 LLM 벤치마크에서 평균 성능 향상 7.45%를 달성하는 데이터 레시피 생성을 가능하게 했습니다.
- GPT-4 쌍대 평가에서 Data-Juicer의 데이터 레시피로 훈련된 모델은 기준 레시피 대비 17.5% 높은 승리 비율을 기록했습니다.
- Ray를 사용해 다중 노드로 확장할 경우, StackExchange 및 arXiv 데이터셋에서 처리 시간이 각각 최대 87.4%와 84.6% 감소했습니다.
- Data-Juicer는 단일 서버 성능에서 Ray와 Beam을 모두 능가했으며, Ray에서는 비례적 확장성이 나타났지만, Beam은 I/O 병목 현상으로 인해 성능 향상이 거의 없었습니다.
- Data-Juicer는 알리바바 클라우드의 산업용 LLM인 Dianjin, Zhiwen, Xingchen에 성공적으로 통합되어 금융, 독서 보조, 캐릭터 커스터마이제이션 등 다양한 분야에서 실용적 적용 가능성을 입증했습니다.
- Data-Juicer에 통합된 중국어 확장 품질 분류기는 원본 영문 GPT-3 분류기와 유사한 데이터 유지 비율을 유지하여 다국어 일관성을 입증했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.