Skip to main content
QUICK REVIEW

[論文レビュー] The Nordic Pile: A 1.2TB Nordic Dataset for Language Modeling

Joey Öhman, Severine Verlinden|arXiv (Cornell University)|Mar 30, 2023
Natural Language Processing Techniques被引用数 4
ひとこと要約

ノルディック・パイルは、デンマーク語、アイスランド語、ノルウェー語、スウェーデン語、英語の高品質なテキストを含む1.2TBの多言語データセットであり、低リソースなノルディック言語向けの大規模言語モデル(LLM)の訓練を目的として構築されたものである。このデータセットは、The Pile や OSCAR にインspiredされた、データ収集、重複除去、フィルタリング、品質管理の複数段階のパイプラインを用いており、多様性があり代表的で、GDPRに準拠したコーパスを実現しており、最先端のノルディック LLM の訓練に最適化されている。

ABSTRACT

Pre-training Large Language Models (LLMs) require massive amounts of text data, and the performance of the LLMs typically correlates with the scale and quality of the datasets. This means that it may be challenging to build LLMs for smaller languages such as Nordic ones, where the availability of text corpora is limited. In order to facilitate the development of the LLMS in the Nordic languages, we curate a high-quality dataset consisting of 1.2TB of text, in all of the major North Germanic languages (Danish, Icelandic, Norwegian, and Swedish), as well as some high-quality English data. This paper details our considerations and processes for collecting, cleaning, and filtering the dataset.

研究の動機と目的

  • 低リソースなノルディック言語向けに大規模かつ高品質なテキストデータが不足しているという問題に対処し、効果的な大規模言語モデル(LLM)の開発を促進すること。
  • 主なノルドゲルマン語と英語をカバーする、代表的で多様性に富み、高品質な多言語コーパスを構築し、大規模 LLM の事前学習に適したものとすること。
  • 低品質、重複、個人を特定する可能性のあるコンテンツを体系的に除外することで、データ品質とGDPR準拠を確保すること。
  • 今後のノルディック NLP 研究および LLM 開発に向け、透明性があり再現可能でスケーラブルなデータパイプラインを提供すること。
  • 言語的・文化的文脈に適合した、高性能な多言語 LLM の開発を促進すること。

提案手法

  • Common Crawl 衍生データ(例:mC4、OSCAR)、Wikipedia ダンプ、パブリックコードリポジトリ、学術論文、書籍、フォーラム(例:Reddit)、およびキュレートされたタスク固有のデータセットなど、多様なソースからのデータ収集。
  • fastText を用いた言語識別を適用し、ドキュメントを言語別にフィルタリング・分類することで、デンマーク語、アイスランド語、ノルウェー語、スウェーデン語、英語の多言語カバレッジを確保。
  • コンテンツフィルタリング、テキスト抽出、Kneser-Ney 言語モデルを用いた品質フィルタリング、繰り返し削除を含む複数段階のデータパイプラインの実装。
  • ドキュメントレベルの重複除去のため、MinHash 局所性に敏感なハッシュ(MinHash LSH)を用いることで、冗長性を低減し、学習効率を向上。
  • コンピュータ生成テキスト、PDF から抽出されたノイズ、個人情報リスクの高いデータなど、低品質コンテンツを除外するためのカスタムフィルタリングパイプラインの適用。
  • 最終的なデータセットは、一貫性のあるフォーマットと包括的なメタデータを備えた JSON Lines 形式で構造化されており、再現性と利用可能性を確保。

実験結果

リサーチクエスチョン

  • RQ1低リソースなノルディック言語向けに、大規模かつ高品質な多言語データセットを体系的に構築する方法は何か?
  • RQ2代表的で多様性に富み、品質が高く、冗長性とプライバシーリスクを最小限に抑えるためのデータ収集およびフィルタリング戦略は何か?
  • RQ3キュレート済みで重複除去およびフィルタリングされたデータセットが、ノルディック言語向けに訓練された LLM のパフォーマンスにどの程度向上効果をもたらすか?
  • RQ4ヨーロッパにおける大規模なウェブデータ収集を NLP 研究の文脈で実施するにあたり、GDPR準拠をどのように達成できるか?
  • RQ5効果的なノルディック LLM の訓練に最適な、データ量、言語的多様性、ドメイン表現のバランスは何か?

主な発見

  • ノルディック・パイルは、5つの言語にわたる1.2TBのクリーニング済み・フィルタリング済み・重複除去済みのテキストを含み、英語が40.24%、スウェーデン語が26.02%、ノルウェー語が11.55%、デンマーク語が10.8%、アイスランド語が1.59%を占める。
  • Bash、JavaScript、Python、SQL のコードが合計114.5GB含まれており、並列データセットやタスク固有データセットを含む雑多なデータが159.55GB存在する。
  • Web CC(Common Crawl 衍生)データが最大の寄与を示し、461.47GB を占め、次に Wikipedia(16.71GB)、Articles(150.77GB)が続く。
  • 低品質なソース(例:PDF から抽出されたテキスト、YouTube 字幕などコンピュータ生成テキスト)を除外する厳密な品質管理を経て構築された。
  • 慎重なキュレーションにもかかわらず、著者らは現在のヨーロッパの法制度により、処理済みデータセットの公開が不可能であると指摘しており、今後のノルディック LLM 開発における重要な規制的障壁を示している。
  • 最終的なデータセットは、ドメイン、言語、テキストスタイルにわたる強力な一般化性能を発揮する、数十億パラメータの LLM の訓練を支援するように設計されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。