Skip to main content
QUICK REVIEW

[논문 리뷰] How to Train Data-Efficient LLMs

Noveen Sachdeva, Benjamin Coleman|arXiv (Cornell University)|2024. 02. 15.
Advanced Data Storage Technologies인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Model, LLM)의 사전 훈련에서 데이터 효율성을 향상시키기 위해 데이터 품질과 커버리지의 우선순위를 각각 두는 Ask-LLM과 디퍼지티 샘플링을 제안한다. Ask-LLM은 소규모 지시 편향 LLM을 사용해 훈련 예제의 품질을 평가하여, 전체 데이터의 90%가 제거된 상태에서도 전체 데이터 훈련보다 뛰어난 성능을 달성하며, 수렴 속도는 최대 70% 빠르게 한다.

ABSTRACT

The training of large language models (LLMs) is expensive. In this paper, we study data-efficient approaches for pre-training LLMs, i.e., techniques that aim to optimize the Pareto frontier of model quality and training resource/data consumption. We seek to understand the tradeoffs associated with data selection routines based on (i) expensive-to-compute data-quality estimates, and (ii) maximization of coverage and diversity-based measures in the feature space. Our first technique, Ask-LLM, leverages the zero-shot reasoning capabilities of instruction-tuned LLMs to directly assess the quality of a training example. To target coverage, we propose Density sampling, which models the data distribution to select a diverse sample. In our comparison of 19 samplers, involving hundreds of evaluation tasks and pre-training runs, we find that Ask-LLM and Density are the best methods in their respective categories. Coverage sampling can recover the performance of the full data, while models trained on Ask-LLM data consistently outperform full-data training -- even when we reject 90% of the original dataset, while converging up to 70% faster.

연구 동기 및 목표

  • 파wer-법 스케일링으로 인해 수익 감소 현상이 발생하는 대규모 언어 모델(LLM) 사전 훈련의 높은 계산 및 데이터 비용 문제를 해결한다.
  • LLM 사전 훈련에서 데이터 품질 평가와 커버리지 최적화 중 어느 것이 더 뛰어난 데이터 효율성을 제공하는지 조사한다.
  • 실제 LLM 훈련 환경에서 비용이 많이 드는 품질 기반 샘플링과 저렴한 커버리지 기반 샘플링 간의 상호 교환 관계를 평가한다.
  • 데이터 정제가 모델 품질 대비 데이터/자원 소비의 파레토 경계를 향상시킬 수 있는지 확인한다.
  • 다양한 모델 크기와 평가 작업을 기반으로 19가지 샘플링 전략에 대한 대규모 실증 벤치마크를 제공한다.

제안 방법

  • 무작위 추론 능력을 지닌 지시 편향 LLM(예: Flan-T5-XL)을 사용해 훈련 예제의 정보성과 품질 기반 점수를 평가하는 데이터 선택 방법인 Ask-LLM을 제안한다.
  • 잠재 특성 분포를 모델링하여 다양하고 대표적인 샘플을 선택하는 커버리지 중심의 접근 방식인 디퍼지티 샘플링을 구현한다.
  • Ask-LLM에서 데이터 품질의 Proxy로 퍼플렉서티 기반 필터링을 사용하며, 낮은 퍼플렉서티는 높은 품질을 의미한다.
  • T5-Large(800M)와 T5-Small(60M) 모델을 19가지 다른 샘플링 전략을 사용해 정제된 데이터 서브셋으로 훈련한다.
  • 피지테이닝 후 111개의 다운스트림 NLP 작업에서 모든 모델을 평가하여 성능과 수렴 속도를 종합적으로 비교한다.
  • 수렴 속도, 샘플러 간 상관관계, 샘플링 비용이 다운스트림 성능에 미치는 영향을 분석하여 데이터 효율성의 주요 원인을 규명한다.
Figure 1 : Data-efficient pre-training run of T5-Large ( $800$ M) using Ask-LLM with Flan-T5-XL as the data quality scorer. Training on $60$ % of the original dataset, Ask-LLM is able to train T5-Large both better and $70$ % faster, compared to training on $100$ % of the dataset.
Figure 1 : Data-efficient pre-training run of T5-Large ( $800$ M) using Ask-LLM with Flan-T5-XL as the data quality scorer. Training on $60$ % of the original dataset, Ask-LLM is able to train T5-Large both better and $70$ % faster, compared to training on $100$ % of the dataset.

실험 결과

연구 질문

  • RQ1LLM을 사용한 품질 기반 데이터 선택이 전체 데이터 훈련 대비 모델 성능과 훈련 속도 측면에서 승리할 수 있는가?
  • RQ2커버리지 기반 샘플링(예: 디퍼지티)이 전체 데이터 사전 훈련의 성능을 복원할 수 있는가?
  • RQ3다양한 모델 크기와 샘플링 비율에서 데이터 품질과 커버리지 간의 상호 교환 관계가 모델 성능에 어떻게 영향을 미치는가?
  • RQ4품질 평가의 계산 비용이 단순한 커버리지 히우리스틱보다 성능 향상에 비례하는가?
  • RQ5데이터 정제 기법이 LLM 사전 훈련에서 모델 품질 대비 데이터/자원 소비의 파레토 경계를 이동시킬 수 있는가?

주요 결과

  • Ask-LLM은 전체 데이터 훈련을 항상 능가하며, 훈련 데이터의 90%가 제거된 상태에서도 더 뛰어난 다운스트림 성능을 달성한다.
  • Ask-LLM으로 훈련된 모델는 상당히 적은 데이터를 사용함에도 불구하고 전체 데이터셋으로 훈련한 모델보다 최대 70% 더 빠르게 수렴한다.
  • 디퍼지티 샘플링은 데이터 분포 내 잠재 주제의 커버리지를 최대화하여 전체 데이터 사전 훈련의 성능을 복원한다.
  • Ask-LLM의 소형 프록시 모델(60M 파라미터)은 대부분의 기존 데이터 정제 베이스라인보다 뛰어난 성능을 달성한다.
  • Ask-LLM의 성능이 전체 데이터 훈련을 초월함으로써, 데이터 품질 필터링이 단순히 데이터 양을 늘리는 것보다 더 큰 이점을 제공할 수 있음을 시사한다.
  • 본 연구는 데이터 정제 기법이 모델 품질 대비 데이터/자원 소비의 파레토 경계를 이동시킬 수 있음을 입증하며, 더 적은 데이터와 계산 자원으로도 고성능 모델을 구현할 수 있음을 보여준다.
Figure 2 : While there is no inherent tradeoff between coverage and quality, samplers target these metrics on a spectrum (up and to the left indicates a more aggressive prioritization). See Appendix B for a description of the plotted samplers.
Figure 2 : While there is no inherent tradeoff between coverage and quality, samplers target these metrics on a spectrum (up and to the left indicates a more aggressive prioritization). See Appendix B for a description of the plotted samplers.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.