Skip to main content
QUICK REVIEW

[논문 리뷰] The Nordic Pile: A 1.2TB Nordic Dataset for Language Modeling

Joey Öhman, Severine Verlinden|arXiv (Cornell University)|2023. 03. 30.
Natural Language Processing Techniques인용 수 4
한 줄 요약

노르딕 파일은 덴마크어, 아이슬란드어, 노르웨이어, 스웨덴어, 영어 등 저자원 노르드 언어를 위한 대규모 언어 모델(LM) 훈련을 위해 고도로 정제된 텍스트를 포함하는 1.2TB의 다국어 데이터셋이다. 이 데이터셋은 The Pile와 OSCAR를 영감으로 삼아, 데이터 수집, 중복 제거, 필터링, 품질 제어의 다단계 파이프라인을 통해 구성되었으며, 다양하고 대표성 있는, GDPR에 부합하는 코퍼스로, 최신 노르드 LLM 훈련을 최적화하였다.

ABSTRACT

Pre-training Large Language Models (LLMs) require massive amounts of text data, and the performance of the LLMs typically correlates with the scale and quality of the datasets. This means that it may be challenging to build LLMs for smaller languages such as Nordic ones, where the availability of text corpora is limited. In order to facilitate the development of the LLMS in the Nordic languages, we curate a high-quality dataset consisting of 1.2TB of text, in all of the major North Germanic languages (Danish, Icelandic, Norwegian, and Swedish), as well as some high-quality English data. This paper details our considerations and processes for collecting, cleaning, and filtering the dataset.

연구 동기 및 목표

  • 저자원 노르드 언어를 위한 대규모 고품질 텍스트 데이터의 부족 문제를 해결하여, 효과적인 대규모 언어 모델(LLM) 개발을 가능하게 하기 위해.
  • 주요 북게르만어 언어와 영어를 포괄하는 대표성 있고 다양한 고품질 다국어 코퍼스를 구축하여, 대규모 LLM의 사전 훈련에 적합한 자료를 제공하기 위해.
  • 저품질, 중복, 개인 정보를 포함한 콘텐츠를 체계적으로 제거하여 데이터 품질과 GDPR 준수를 확보하기 위해.
  • 미래의 노르드 NLP 연구 및 LLM 개발을 위한 투명하고 재현 가능하며 확장 가능한 데이터 파이프라인을 제공하기 위해.
  • 노르드 지역의 언어적 및 문화적 맥락에 맞는 고성능 다국어 LLM 개발을 촉진하기 위해.

제안 방법

  • Common Crawl 유사 자료(예: mC4, OSCAR), 위키백과 덤프, 공개 코드 리포지터리, 학술 논문, 책, 포럼(예: Reddit), 그리고 특수 작업에 맞게 정제된 데이터셋을 포함한 다양한 출처에서의 데이터 수집.
  • 언어 식별을 위해 fastText를 활용하여 문서를 언어별로 필터링 및 분류함으로써 덴마크어, 아이슬란드어, 노르웨이어, 스웨덴어, 영어의 다국어 커버리지 확보.
  • 콘텐츠 필터링, 텍스트 추출, Kneser-Ney 언어 모델을 활용한 품질 필터링, 반복 제거를 포함한 다단계 데이터 파이프라인 구현.
  • 문서 수준의 중복 제거를 위해 MinHash Locality Sensitive Hashing(MinHash LSH)를 활용하여 레이어 간 중복을 줄이고 훈련 효율성을 향상시킴.
  • 컴퓨터가 생성한 텍스트, PDF에서 추출된 노이즈, 개인 정보 위험이 높은 데이터 등 저품질 콘텐츠를 제외하기 위한 맞춤형 필터링 파이프라인 적용.
  • 재현 가능성과 사용성 향상을 위해 일관된 형식과 포괄적인 메타데이터를 포함한 JSON Lines 형식으로 최종 데이터셋 구조화.

실험 결과

연구 질문

  • RQ1저자원 노르드 언어를 위한 대규모 고품질 다국어 데이터셋을 체계적으로 구축하는 방법은 무엇인가?
  • RQ2대표성, 다양성, 품질을 극대화하면서도 중복과 개인정보 위험을 최소화하는 데이터 수집 및 필터링 전략은 무엇인가?
  • RQ3정제되고 중복 제거된, 필터링된 데이터셋이 노르드 언어로 훈련된 LLM의 성능에 어느 정도 기여하는가?
  • RQ4유럽의 대규모 웹 데이터 수집을 위한 NLP 연구 맥락에서 GDPR 준수는 어떻게 달성할 수 있는가?
  • RQ5효과적인 노르드 LLM 훈련을 위해 데이터 양, 언어 다양성, 도메인 표현 간 최적의 균형은 무엇인가?

주요 결과

  • 노르딕 파일은 총 1.2TB의 정제되고 필터링된, 중복 제거된 텍스트로 구성되어 있으며, 영어가 40.24%, 스웨덴어가 26.02%, 노르웨이어가 11.55%, 덴마크어가 10.8%, 아이슬란드어가 1.59%를 차지한다.
  • Bash, 자바스크립트, 파이썬, SQL 등 총 114.5GB의 코드와, 평행 데이터셋 및 작업 전용 데이터셋을 포함한 다양한 데이터 159.55GB가 포함되어 있다.
  • 웹 CC(공통 크롤러 유사 자료) 데이터가 461.47GB로 가장 큰 비중을 차지하며, 이어 위키백과(16.71GB)와 논문(150.77GB)이 뒤를 이룬다.
  • 저품질 자료(예: PDF에서 추출된 텍스트, 유튜브 자막 등 컴퓨터 생성 텍스트)를 배제하는 철저한 품질 제어를 통해 제작되었음.
  • 철저한 정제에도 불구하고, 저자들은 현재 유럽 법률상 처리된 데이터셋의 공개 배포가 불가능하다고 지적하며, 향후 노르드 LLM 개발에 있어 중요한 규제 장벽을 드러냈다.
  • 최종 데이터셋은 도메인, 언어, 텍스트 스타일에 걸쳐 강력한 일반화 능력을 갖춘 다기억 파rameter LLM 훈련을 지원하도록 설계되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.