Skip to main content
QUICK REVIEW

[논문 리뷰] The MiniPile Challenge for Data-Efficient Language Models

Jean Kaddour|arXiv (Cornell University)|2023. 04. 17.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 학계의 예산으로도 활용 가능한 데이터 효율적인 언어 모델 사전 훈련을 가능하게 하기 위해, 100만 개의 문서를 포함하고 총 용량이 6GB인 The Pile의 정제된 서브셋인 MiniPile을 소개한다. 세 단계로 구성된 프로세스—E5-Large 문장 임bedding 모델을 사용한 임베딩 추론, 코사인 거리 기반 k-means 군집화, 그리고 저품질 군집에 대한 인간이 가이드하는 필터링—를 통해 BERT 및 T5 모델을 훈련시킬 때, 각각 GLUE 및 SNI 벤치마크에서 원본 모델 대비 각각 1.9%와 2.5%의 성능 저하만을 기록하며, 이는 훨씬 더 많은 데이터(2.6배에서 745배)로 사전 훈련된 모델들과 비교해도 매우 높은 성능 유지를 보여준다.

ABSTRACT

The ever-growing diversity of pre-training text corpora has equipped language models with generalization capabilities across various downstream tasks. However, such diverse datasets are often too large for academic budgets; hence, most research on Transformer architectures, training procedures, optimizers, etc. gets conducted on smaller, homogeneous datasets. To this end, we present The MiniPile Challenge, where one pre-trains a language model on a diverse text corpus containing at most 1M documents. MiniPile is a 6GB subset of the deduplicated 825GB The Pile corpus. To curate MiniPile, we perform a simple, three-step data filtering process: we (1) infer embeddings for all documents of the Pile, (2) cluster the embedding space using $k$-means, and (3) filter out low-quality clusters. To verify MiniPile's suitability for language model pre-training, we use it to pre-train a BERT and T5 model, yielding a performance drop of only $1.9\%$/$2.5\%$ on the GLUE and SNI benchmarks compared to the original pre-trained checkpoints trained on $2.6$x/$745$x the amount of data. MiniPile is available at https://huggingface.co/datasets/JeanKaddour/minipile.

연구 동기 및 목표

  • 제한된 컴퓨팅 자원을 가진 연구자들이 다양한 고품질 코퍼스에서 모델을 훈련시킬 수 있도록 데이터 효율적인 사전 훈련의 격차를 해소한다.
  • 모델 일반화 능력을 제한하는 작은, 동질적인 데이터셋(예: WikiText103 또는 enwik8)에 대한 의존도를 줄인다.
  • 다양성을 유지하면서 저품질 및 해로운 콘텐츠를 필터링하는, 확장 가능한 정제된 The Pile의 대안을 만든다.
  • 100만 개의 문서로 구성된 서브셋이 전체 규모의 사전 훈련에 비해 정확도 저하가 최소한이 되도록 강력한 최종 성능을 낼 수 있음을 입증한다.
  • 데이터 효율적 훈련 방법을 평가하기 위한 재현 가능한, 공개된 기준 데이터셋을 제공한다.

제안 방법

  • E5-Large 문장 임베딩 모델을 사용해 정제된 825GB의 The Pile에 포함된 모든 문서의 밀도 임베딩을 추출한다.
  • 정규화된 임베딩에 대해 배치 처리된 k-means 군집화를 적용하며, 코사인 거리를 사용하고 군집 수 k=220(각 The Pile 서브데이터셋당 10개)로 설정한다.
  • 문서가 군집 중심점에서의 거리와 인간 평가자가 대표 예시(가장 가까운 5개, 가장 먼 5개)를 평가함으로써 군집을 필터링한다.
  • 근접 복제, 포르노그래픽 콘텐츠, 네비게이션 바 등 콘텐츠 품질이 낮다고 판단되는 군집은 제외한다.
  • 정제된 MiniPile 서브셋을 사용해 BERT-Base 및 T5-Base 모델을 사전 훈련하여 최종 성능을 평가한다.
  • GLUE 및 SNI 벤치마크에서 미세조정된 모델의 성능을, 훨씬 더 큰 코퍼스로 사전 훈련된 원본 모델과 비교한다.
Figure 1: MiniPile and Other Pre-Training Datasets.
Figure 1: MiniPile and Other Pre-Training Datasets.

실험 결과

연구 질문

  • RQ1The Pile의 100만 개 문서, 6GB 서브셋인 MiniPile이, 훨씬 더 큰 데이터셋으로 사전 훈련된 모델들과 경쟁 가능한 최종 성능을 달성할 수 있는가?
  • RQ2문서 임베딩의 군집 기반 필터링이 정보가 풍부한 데이터를 유지하면서도 저품질 및 해로운 콘텐츠를 효과적으로 제거할 수 있는가?
  • RQ3MiniPile이 얼마나 많은 자연어 처리 작업에 걸쳐 일반화 능력을 유지하는가?
  • RQ4WikiText103과 같은 작은, 동질적인 데이터셋으로 사전 훈련하는 것과 비교해, MiniPile에서의 사전 훈련은 최종 성능에 어떤 영향을 미치는가?
  • RQ5군집 수준의 표현에 인간이 참여하는 필터링 단계를 통해, 전체 코퍼스를 검토할 필요 없이도 고품질이고 확장 가능한 데이터셋을 만들 수 있는가?

주요 결과

  • BERT-Base를 MiniPile에서 사전 훈련한 결과, 원본 BERT 모델(16GB 데이터로 사전 훈련) 대비 GLUE 벤치마크에서 1.9% 성능 저하를 보였다.
  • T5-Base를 MiniPile에서 사전 훈련한 결과, 원본 T5 모델(745배 더 많은 데이터로 사전 훈련) 대비 SNI 벤치마크에서 2.5% 성능 저하를 보였다.
  • 6GB이자 100만 개의 문서로 구성된 MiniPile 데이터셋은 여전히 충분한 다양성과 정보량을 유지하여 강력한 최종 일반화 성능을 지원한다.
  • 군집 중심점에서의 거리와 대표 예시 평가 기반의 인간 가이드 필터링이 성공적으로 유해하고 저품질 콘텐츠(근접 복제, 명시적 콘텐츠 포함)를 제거했다.
  • 군집 내에서 무작위 샘플링이 중심점에서 가장 가까운 문서만 선택하는 것보다 성능이 뛰어나, 외곽치 제거만으로는 최적의 사전 훈련이 불가능하다는 것을 시사한다.
  • MiniPile 데이터셋은 huggingface.co/datasets/jeankaddour/minipile에서 공개되어 있으며, 데이터 효율적 NLP 분야의 재현 가능한 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.