Skip to main content
QUICK REVIEW

[논문 리뷰] OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text

Keiran Paster, Marco Dos Santos|arXiv (Cornell University)|2023. 10. 10.
Mathematics, Computing, and Information Processing인용 수 4
한 줄 요약

OpenWebMath는 Common Crawl에서 추출한 고품질 수학 웹 텍스트를 유지하면서 LaTeX 표기법을 보존한 오픈 소스 14.7B 토큰 데이터셋입니다. 이 데이터셋을 기반으로 훈련된 1.4B 파라미터 모델은 일반 도메인 토큰의 20배가 넘는 데이터로 훈련된 모델보다 우수한 성능을 보이며, 도메인 특화 사전 훈련이 언어 모델의 수학적 추론 능력을 크게 향상시킨다는 것을 입증합니다.

ABSTRACT

There is growing evidence that pretraining on high quality, carefully thought-out tokens such as code or mathematics plays an important role in improving the reasoning abilities of large language models. For example, Minerva, a PaLM model finetuned on billions of tokens of mathematical documents from arXiv and the web, reported dramatically improved performance on problems that require quantitative reasoning. However, because all known open source web datasets employ preprocessing that does not faithfully preserve mathematical notation, the benefits of large scale training on quantitive web documents are unavailable to the research community. We introduce OpenWebMath, an open dataset inspired by these works containing 14.7B tokens of mathematical webpages from Common Crawl. We describe in detail our method for extracting text and LaTeX content and removing boilerplate from HTML documents, as well as our methods for quality filtering and deduplication. Additionally, we run small-scale experiments by training 1.4B parameter language models on OpenWebMath, showing that models trained on 14.7B tokens of our dataset surpass the performance of models trained on over 20x the amount of general language data. We hope that our dataset, openly released on the Hugging Face Hub, will help spur advances in the reasoning abilities of large language models.

연구 동기 및 목표

  • 수학적 표기법을 유지하는 공개 가능하고 고품질의 웹 기반 수학 텍스트 데이터셋이 부족한 문제를 해결하기 위해.
  • 대규모로 총집된 정제된 데이터셋을 공개함으로써 수학적 추론, 기억력, 일반화 연구를 촉진하기 위해.
  • 도메인 특화 고품질 수학 콘텐츠로 사전 훈련하는 것이 일반 도메인 사전 훈련보다 수학적 추론 성능 향상에 더 효과적임을 입증하기 위해.
  • 대규모로 수학 웹 콘텐츠를 추출, 필터링, 중복 제거하는 재현 가능한 파이프라인을 공개하기 위해.

제안 방법

  • HTML 보일러플레이트를 제거하고 LaTeX 콘텐츠를 유지하는 파이프라인을 사용해 Common Crawl에서 14.7B 토큰을 추출함.
  • LLM과 규칙 기반 히우리스틱을 복수 단계로 적용해 고품질, 영어, 수학적 콘텐츠만 유지함.
  • 문서 유형과 도메인 간 주제 분포 분석을 위해 클러스터링 및 LLM 기반 분류 기법을 사용함.
  • 임베딩 기반 기법을 활용해 근접 중복 콘텐츠를 제거함.
  • OpenWebMath를 기반으로 1.4B 파라미터 언어 모델을 훈련하고, The Pile 및 ProofPile 기반 모델과 성능을 비교함.
  • MATH, GSM8k, LILA-multiarith 벤치마크에서 모델의 최종 추론 성능을 평가함.

실험 결과

연구 질문

  • RQ1LaTeX 표기법을 유지한 대규모 오픈 소스 웹 기반 수학 텍스트 데이터셋이 대규모 언어 모델의 추론 능력을 향상시킬 수 있는가?
  • RQ2OpenWebMath로 사전 훈련한 모델의 성능은 일반 도메인 데이터의 20배가 넘는 토큰으로 훈련한 모델보다 수학적 추론 성능에서 어떻게 비교되는가?
  • RQ3OpenWebMath를 다른 수학 데이터셋과 조합했을 때 모델 성능에 어떤 영향을 미치는가?
  • RQ4사전 훈련 데이터의 품질과 도메인 특화 정도가 모델의 일반화 및 기억력에 어떤 영향을 미치는가?
  • RQ5제안된 파이프라인은 오픈 웹에서 고품질 수학 콘텐츠를 추출하고 필터링하는 데 얼마나 효과적인가?

주요 결과

  • OpenWebMath의 14.7B 토큰으로 훈련된 모델은 The Pile의 300B 토큰으로 훈련된 Pythia 1.4B보다 MATH-Algebra-Easy 및 GSM8k 벤치마크에서 뛰어난 성능을 보였다.
  • OpenWebMath 전용 모델은 일반 도메인 데이터의 20배가 넘는 토큰으로 훈련된 모델보다 MATH 및 GSM8k에서 더 낮은 퍼플렉서티를 기록했다.
  • OpenWebMath와 ProofPile를 50/50 비율로 혼합한 모델이 테스트한 모든 벤치마크에서 최고의 종합 성능을 기록했다.
  • 데이터셋은 고품질 수학 콘텐츠 14.7B 토큰을 포함하고 있으며, 이 중 88%의 문서가 수학, 물리학, 컴퓨터 과학 또는 관련 기술 분야에 속한다.
  • 포럼 게시물(예: Math StackExchange)과 교육 콘텐츠가 가장 큰 비중을 차지했으며, 12%의 문서는 핵심 과학기술 분야로 명확히 분류되지 않았다.
  • 파이프라인이 LaTeX 표기법을 성공적으로 유지했고, 비수학적 보일러플레이트의 90%를 제거하여 사전 훈련에 적합한 깔끔하고 고정밀도의 데이터셋을 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.