[논문 리뷰] Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
이 논문은 대규모 사전학습 데이터셋을 정제하기 위해 소형 언어모델(125M 파라미터)을 사용해 퍼플렉서티 점수를 계산함으로써, 더 큰 모델(3B 파라미터)의 미세조정 성능을 크게 향상시키는 방법을 제안한다. 다양한 데이터셋 구성에서 평균적으로 2.04점까지 상향되는 미세조정 성능 향상과 동시에 사전학습 단계를 최대 1.45배 감소시킴으로써 사전학습 효율성이 크게 향상됨을 보여준다.
In this work, we investigate whether small language models can determine high-quality subsets of large-scale text datasets that improve the performance of larger language models. While existing work has shown that pruning based on the perplexity of a larger model can yield high-quality data, we investigate whether smaller models can be used for perplexity-based pruning and how pruning is affected by the domain composition of the data being pruned. We demonstrate that for multiple dataset compositions, perplexity-based pruning of pretraining data can \emph{significantly} improve downstream task performance: pruning based on perplexities computed with a 125 million parameter model improves the average performance on downstream tasks of a 3 billion parameter model by up to 2.04 and achieves up to a $1.45 imes$ reduction in pretraining steps to reach commensurate baseline performance. Furthermore, we demonstrate that such perplexity-based data pruning also yields downstream performance gains in the over-trained and data-constrained regimes.
연구 동기 및 목표
- 소형 언어모델이 사전학습용 대규모 언어모델의 고품질 데이터셋을 효과적으로 식별할 수 있는지 평가하기 위해.
- 퍼플렉서티 기반 데이터 정제의 효과성에 영향을 미치는 데이터셋 도메인 구성의 영향을 조사하기 위해.
- 과학습 및 자원 제약 조건과 같은 비표준 학습 환경에서 퍼플렉서티 기반 정제의 영향을 평가하기 위해.
- 데이터 정제 개입에서 상游 테스트 세트 퍼플렉서티가 상游 성능 향상에 대한 신뢰할 수 있는 지표인지 판단하기 위해.
- 다양한 도메인 분포를 가진 데이터셋(예: Pile 및 Dolma) 간에 퍼플렉서티 기반 정제의 효능을 비교하기 위해.
제안 방법
- 사전학습 데이터셋의 무작위 부분집합에 대해 소형 기준 언어모델(125M 파라미터)을 훈련한다.
- 소형 기준 모델을 사용해 전체 데이터셋의 각 샘플에 대해 퍼플렉서티 점수를 계산한다.
- 특정 퍼플렉서티 범위 내의 샘플을 선택함으로써 데이터셋을 정제한다—즉, 가장 낮거나 가장 높은 퍼플렉서티 점수를 가진 샘플을 선택한다.
- 정제된 데이터셋으로 더 큰 타겟 모델(3B 파라미터)을 미세조정하고, 상游 성능을 평가한다.
- 여러 상游 벤치마크(MMLU, HellaSwag, BIG-bench 등)를 사용해 상游 메트릭스를 넘어서는 모델 성능 평가를 수행한다.
- 다양한 도메인 구성(예: Pile의 다양한 코어된 도메인 및 Dolma의 웹 스크래핑 데이터 포함)을 가진 데이터셋 간의 정제 결과를 비교한다.
실험 결과
연구 질문
- RQ1소형 기준 모델이 훨씬 더 큰 타겟 언어모델의 성능 향상에 기여하는 고품질 데이터셋을 효과적으로 식별할 수 있는가?
- RQ2사전학습 데이터셋의 도메인 구성이 퍼플렉서티 기반 데이터 정제의 효능에 어떤 영향을 미치는가?
- RQ3과학습 및 자원 제약 조건의 학습 환경에서 퍼플렉서티 기반 데이터 정제가 성능 향상에 기여하는가?
- RQ4상유 테스트 세트 퍼플렉서티가 데이터 정제 개입으로 인한 상유 성능 향상에 대한 신뢰할 수 있는 지표인가?
- RQ5다른 도메인 분포를 가진 데이터셋에서 다양한 정제 전략(예: 낮은 퍼플렉서티 샘플 vs. 높은 퍼플렉서티 샘플 선택)의 효과성은 어떻게 다를까?
주요 결과
- 125M 파라미터 기준 모델을 사용한 퍼플렉서티 기반 정제로 인해 3B 파라미터 타겟 모델의 평균 상유 성능이 벤치마크 평가에서 최대 2.04점 향상되었다.
- 동일한 정제 전략은 기준 성능에 도달하기 위한 사전학습 단계 수를 최대 1.45배 감소시켜 뚜렷한 학습 효율성 향상을 보였다.
- 정제 효과는 데이터셋 간에 크게 달라졌다: 이 방법은 도메인이 다양하고 코어된 도메인을 포함한 Pile에서는 가장 효과적이었고, 웹 스크래핑에 의해 편향된 Dolma에서는 덜 효과적이었으며, 도메인 구성에 매우 민감한 것으로 나타났다.
- 퍼플렉서티 기반 정제는 과학습 및 자원 제약 조건의 학습 환경 모두에서 측정 가능한 성능 향상을 가져왔으며, 표준 사전학습 설정을 초월한 강건성을 입증했다.
- 상유 테스트 세트 퍼플렉서티는 데이터 정제의 효율성을 평가하는 데 잘못된 지표로 밝혀졌다. 일부 개입은 상유 메트릭스에 영향을 주지 않았지만 상유 성능 향상을 가져왔다.
- 이 연구는 타겟 모델의 파라미터 수가 30배나 더 큰 경우에도 소형 기준 모델이 데이터 품질 필터링을 위한 효과적인 대체 지표가 될 수 있음을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.