[論文レビュー] ÜberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset
この論文は、言語固有のデータキュレーションが多言語モデルの性能と計算効率を向上させ、20Tトークンのキュレーション事前学習コーパスと大幅に少ない計算量で強力な多言語結果を達成して新しいパレート前線を切り開くことを示しています。
Multilinguality is a core capability for modern foundation models, yet training high-quality multilingual models remains challenging due to uneven data availability across languages. A further challenge is the performance interference that can arise from joint multilingual training, commonly referred to as the "curse of multilinguality". We study multilingual data curation across thirteen languages and find that many reported regressions are not inherent to multilingual scaling but instead stem from correctable deficiencies in data quality and composition rather than fundamental capacity limits. In controlled bilingual experiments, improving data quality for any single language benefits others: curating English improves non-English performance in 12 of 13 languages, while curating non-English yields reciprocal improvements in English. Bespoke per-language curation produces substantially larger within-language improvements. Extending these findings to large-scale general-purpose training mixtures, we show that curated multilingual allocations comprising under 8% of total tokens remain remarkably effective. We operationalize this approach within an effort that produced a 20T-token pretraining corpus derived entirely from public sources. Models with 3B and 8B parameters trained on a 1T-token random subset achieve competitive multilingual accuracy with 4-10x fewer training FLOPs than strong public baselines, establishing a new Pareto frontier in multilingual performance versus compute. Moreover, these benefits extend to frontier model scale: the 20T-token corpus served as part of the pretraining dataset for Trinity Large (400B/A13B), which exhibits strong multilingual performance relative to its training FLOPs. These results show that targeted, per-language data curation mitigates multilingual interference and enables compute-efficient multilingual scaling.
研究の動機と目的
- データ品質と特定言語に特化したキュレーションが多言語モデルにおけるクロス言語転送を改善することを実証する。
- 英語データの品質向上が非英語言語に利益をもたらし、逆もまた然りで、厳密な容量制限の概念に挑戦する。
- 多言語キュレーションが60Bトークンとフロンティア規模の事前学習の計算効率とスケーリングに与える影響を Illustration する。
- 20T-token事前学習へ拡張可能で、実践的な言語認識のキュレーション枠組みを提供する。
提案手法
- 60Bトークンで訓練された3Bパラメータモデルを用いた制御されたバイリンガル実験を実施し、データ品質の効果を分離する。
- 英語を含む13言語を含む言語別キュレーションパイプラインを構築し、フィルタリング、埋め込みベースの選択、合成データ生成を含める。
- マルチリンガルベンチマーク(Multilingual MMLU、Multilingual ARC、Belebele)と英語の対照を用いて、ゼロショット、選択式、クロース形式で評価する。
- 公開ソースのみにより派生した20T-tokenのキュレーション前提学習コーパスを組み立て、3Bおよび8Bモデルを1T-tokenの一般的な多言語ミックスで訓練する。
- 多言語トークン密度を段階的に増加させる3段階のデータカリキュラムを実装し、スケーラビリティとパレート効率を研究する。
- 未キュレーションのベースラインおよび翻訳強化ベースラインと比較して、データ品質と翻訳の影響を定量化する。
実験結果
リサーチクエスチョン
- RQ1英語データ品質の改善は多言語モデルにおける非英語の性能を向上させるか。
- RQ2非英語データ品質の改善は英語の性能を向上させるか。
- RQ3英語中心の戦略を超える最適な多言語性能を達成するためには、個別言語ごとのキュレーションが必要か。
- RQ4翻訳品質は多言語の利益にどう影響し、ソースデータが高品質であれば特注のキュレーションに匹敵できるか。
- RQ5大規模事前学習において多言語データキュレーションは性能-計算パレート frontierを動かせるか。
主な発見
- 英語データ品質の改善は、13言語に渡る非英語の性能を相対的に平均3.91%向上させる。
- 非英語データ品質の改善は、英語の評価で相対的に平均1.21%の向上をもたらす。
- 個別言語キュレーションは、60Bトークンで訓練された3Bモデルに対して未キュレーションベースラインを最大16.87%相対的に改善する。
- 翻訳の利益はソースデータ品質に依存する。高品質・スコアフィルタ付きの英語データを翻訳することで、ランダム翻訳より大きな利得が得られる。
- 1T-tokenの訓練予算で約8%の多言語データ(13言語合計約80Bトークン)を用い、強力な多言語性能を達成し、強力なベースラインより計算効率を4~10倍向上させる。
- DatologyAIモデルは20T-tokenのキュレーションデータで事前学習され、新しいパレート frontierを定義し、オープンウェイトのベースラインと比較してはるかに少ない計算量で競争力のある多言語精度を達成する。
- 多言語キュレーションはフロンティアモデル(例:Trinity Large)にもスケールし、訓練FLOPsに対して非常に強力な多言語性能を示す。
- 英語への言語的類似性は、英語キュレーションからの転移利得と相関し、近縁言語ほど恩恵を受ける。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。