[논문 리뷰] On the Diversity of Synthetic Data and its Impact on Training Large Language Models
이 논문은 대규모 언어 모델을 사용하여 의미적 특성의 군집을 통해 합성 데이터의 다양성을 측정하는 새로운 프레임워크인 LLM Cluster-agent를 소개한다. 이는 합성 사전학습 데이터의 다양성이 높을수록 대규모 언어 모델의 사전학습 및 미세조정 성능이 뚜렷이 향상됨을 보여주며, 특히 미세조정 성능에 미치는 영향이 사전학습 성능에 비해 더 두드러진다.
The rise of Large Language Models (LLMs) has accentuated the need for diverse, high-quality pre-training data. Synthetic data emerges as a viable solution to the challenges of data scarcity and inaccessibility. While previous literature has focused predominantly on the quality and quantity of real data, our work enables the measurement of diversity in synthetic data and explores its impact on LLM performance. We study the downstream effects of synthetic data diversity during both the pre-training and fine-tuning stages by introducing a new diversity metric, extit{LLM cluster-agent}, designed to evaluate the diversity of synthetic datasets. Through a series of controlled experiments with models of 350M and 1.4B parameters, we demonstrate that the proposed cluster-based LLM scoring of diversity correlates positively with both pre-training and supervised fine-tuning performance. Our findings also reveal that synthetic data diversity in pre-training affects supervised fine-tuning more significantly than pre-training itself, even for smaller models. We hope this study advances our understanding of the optimal use of synthetic data in LLM training and opens new avenues for efficient data generation processes.
연구 동기 및 목표
- 대규모 언어 모델 사전학습에 사용되는 합성 텍스트 데이터의 다양성을 측정하기 위한 신뢰할 수 있는 지표 부족 문제를 해결하기 위해.
- 합성 데이터의 다양성이 대규모 언어 모델의 사전학습 및 미세조정 과정에서 성능에 미치는 영향을 조사하기 위해.
- 기존 지표가 실패하는 대규모 합성 데이터셋에서 효과적으로 작동하는 스케일러블한 LLM 기반 다양성 측정 방법을 개발하기 위해.
- 합성 데이터의 다양성이 LLM 성능을 결정하는 데 있어 데이터 양보다 더 중요한 요소인지 확인하기 위해.
제안 방법
- 합성 데이터셋에서 무작위로 샘플링한 텍스트의 의미적 특성 요약 및 군집을 수행하는 LLM 기반 파이프라인인 LLM Cluster-agent를 제안한다.
- LLM이 데이터 포인트의 주요 특징을 식별하고 이러한 특징을 바탕으로 군집화하도록 유도하는 프롬프트를 설계하며, 신뢰도를 향상시키기 위해 자체 검증 메커니즘을 통합한다.
- 군집화 결과에서 LLM 군집 점수를 계산하여 데이터셋 다양성의 정량적 측정치로 활용한다.
- 기존 지표가 실패하는 대규모 언어 모델과 대규모 합성 데이터셋에서 이 지표의 일관성과 확장성을 검증한다.
- 620,000개의 위키백과 주제를 사용하여 다양성 수준이 다른 합성 데이터를 생성하고, 3.5억 및 14억 파라미터 모델을 훈련하는 제어 실험을 수행한다.
- 사전학습 후 표준 벤치마크에서 성능을 평가하여 다양성 점수와 최종 성능 결과 간의 상관관계를 분석한다.

실험 결과
연구 질문
- RQ1합성 사전학습 데이터의 다양성이 대규모 언어 모델의 사전학습 및 미세조정 성능에 어떻게 영향을 미치는가?
- RQ2기존 지표가 실패하는 대규모 스케일에서 LLM 기반 방법이 합성 텍스트 데이터의 다양성을 신뢰성 있게 측정할 수 있는가?
- RQ3합성 데이터 다양성이 사전학습 성능에 비해 미세조정 성능에 더 큰 영향을 미치는가?
- RQ4합성 데이터 다양성이 LLM 성능을 결정하는 데 있어 데이터 양을 능가하는 정도는 어느 정도인가?
주요 결과
- LLM Cluster-agent 다양성 지표는 3.5억 및 14억 파라미터 모델 전반에서 사전학습 및 미세조정 성능과 정확히 상관관계가 있다.
- 소형 모델일지라도 합성 데이터 다양성이 사전학습 성능에 비해 감독 미세조정 성능에 더 큰 영향을 미친다.
- 제안된 LLM 기반 다양성 측정 방법은 일관성 있고 확장 가능하며 대규모 합성 데이터에서 효과적으로 작동하며, 결과가 일관성 없이 나타나는 기존 지표를 능가한다.
- 연구 결과에 따르면 다양성이 합성 데이터의 핵심 품질 요소이며, 높은 다양성에서 얻는 성능 향상이 데이터 양 증가에서 얻는 성능 향상보다 뚜렷하게 뛰어나다.
- 620,000개의 위키백과 주제를 사용한 제어 실험 결과, 다양한 합성 데이터로 사전학습한 모델은 미세조정 단계에서 더 잘 일반화됨을 확인하여 지표의 예측 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.