Skip to main content
QUICK REVIEW

[論文レビュー] Data-Juicer: A One-Stop Data Processing System for Large Language Models

Daoyuan Chen, Huang Yi-lun|arXiv (Cornell University)|Sep 5, 2023
Topic Modeling被引用数 5
ひとこと要約

Data-Juicer は、Large Language Models (LLMs) のためのワンストップで拡張可能なデータ処理システムであり、50 以上の合成可能で組み合わせ可能なオペレータを用いて、多様なデータレシピの効率的構築、評価、最適化を可能にする。このシステムは、統合された LLM 学習および分散コンピューティングエコシステムを備えたスケーラブルで柔軟かつ自動評価可能なデータパイプライン構成をサポートすることで、16 個の LLM ベンチマークで平均して 7.45% のパフォーマンス向上を達成し、GPT-4 のペairwise 評価では 17.5% の高い勝率を記録した。

ABSTRACT

The immense evolution in Large Language Models (LLMs) has underscored the importance of massive, heterogeneous, and high-quality data. A data recipe is a mixture of data from different sources for training LLMs, which plays a vital role in LLMs' performance. Existing open-source tools for LLM data processing are mostly tailored for specific data recipes. To continuously uncover the potential of LLMs, incorporate data from new sources, and improve LLMs' performance, we build a new system named Data-Juicer, with which we can efficiently generate diverse data recipes, explore different possibilities in forming data mixtures, and evaluate their effects on model performance. Different from traditional data-analytics pipelines, Data-Juicer faces some unique challenges. Firstly, the possible data sources for forming data recipes are truly heterogeneous and massive with various qualities. Secondly, it is extremely expensive to precisely evaluate data recipes' impact on LLMs' performance. Thirdly, the end users of Data-Juicer, model developers, need sufficient flexibility to configure and evaluate different data recipes. Data-Juicer features a fine-grained abstraction of pipelines for constructing data recipes, with over 50 built-in operators for easy composition and extension. By incorporating visualization and auto-evaluation capabilities, Data-Juicer enables a timely feedback loop for both LLM pre-training and fine-tuning. Further, Data-Juicer is optimized and integrated with ecosystems for LLM training, evaluation, and distributed computing. The data recipes derived with Data-Juicer gain notable improvements on state-of-the-art LLMs, by up to 7.45% increase in averaged score across 16 LLM benchmarks and 17.5% higher win rate in pair-wise GPT-4 evaluations. Our system, data recipes, and tutorials are released, calling for broader data-centric research on training and understanding LLMs.

研究の動機と目的

  • LLM のトレーニングおよびファインチューニングにおける異種で高品質なデータレシピの処理に、柔軟で拡張可能かつスケーラブルなオープンソースツールの不足に対処すること。
  • データレシピの評価が高コストかつ遅延が大きいという課題を克服し、自動評価と可視化による即時のフィードバックを可能にすること。
  • エンドユーザーがカスタマイズ可能なパイプラインを用いて多様なデータミックスを効率的に探索でき、汎用的およびドメイン特化タスクの両方でモデルパフォーマンスを向上させること。
  • データ処理コンponents を分離することでモジュール性と合成性を高め、LLM のトレーニング、評価、分散コンピューティングエコシステムへのシームレスな統合を可能にすること。

提案手法

  • Data-Juicer は、データクリーニング、フィルタリング、編集、変換のための 50 以上の組み込みで合成可能なオペレータを用いて、細粒度なデータ処理パイプラインの抽象化を導入する。
  • ユーザーがハイパーパramータを設定可能なオペレータを柔軟に組み合わせることで、カスタマイズ可能なパイプライン構成を通じて多様なデータレシピを探索できる。
  • システムは自動評価と可視化を統合しており、完全なモデル再トレーニングなしでデータレシピの影響について即時のフィードバックを提供する。
  • Ray や Apache Beam などの LLM トレーニング、評価、分散コンピューティングフレームワークとネイティブに最適化され統合されている。
  • 複数ノードにわたるスケーラブルなデータ処理をサポートし、分散 Ray クラスタ上で処理時間を最大 87.4% 削減する性能向上を達成した。
  • ドメイン特化されたデータ処理機能を、特定のオペレータの組み合わせにより実装し、ファイナンス、リーディングアシスタンス、キャラクタカスタマイズなどのユースケースに適応可能にした。

実験結果

リサーチクエスチョン

  • RQ1LLM のトレーニングおよびファインチューニングに適した、多様で異種のデータソースを扱えるモジュラで合成可能なデータ処理システムをどのように設計できるか?
  • RQ2異なるデータレシピの組み合わせが LLM パフォーマンスに与える影響は何か? また、完全なモデル再トレーニングなしでそれを効率的に評価するにはどうすればよいか?
  • RQ3大規模な LLM データパイプラインにおける分散データ処理のスケーラビリティとパフォーマンスをどのように達成できるか?
  • RQ4統合されたデータ処理システムは、複数のベンチマークおよび実世界のアプリケーションにおいて、モデルパフォーマンスをどの程度向上できるか?
  • RQ5LLM のデータレシピ開発において、使いやすさ、カスタマイズ性、自動化のバランスをどのようにとれるか?

主な発見

  • Data-Juicer は、16 個の標準 LLM ベンチマークで平均して 7.45% のパフォーマンス向上を達成するデータレシピの作成を可能にした。
  • GPT-4 のペアワイズ評価において、Data-Juicer のデータレシピでトレーニングされたモデルは、ベースラインレシピに比べて 17.5% の高い勝率を示した。
  • Ray を用いて複数ノードにスケーリングした際、StackExchange および arXiv データセットで処理時間を最大 87.4% および 84.6% 削減した。
  • Data-Juicer は、シングルサーバー性能において Ray や Beam を上回り、Ray では比例的なスケーラビリティを示したが、Beam は I/O ボトル neck により性能がほとんど向上しなかった。
  • システムはアリババクラウドの産業用 LLM(Dianjin、Zhiwen、Xingchen)に成功裏に統合され、ファイナンス、リーディングアシスタンス、キャラクタカスタマイズの分野で実世界の適用性を実証した。
  • Data-Juicer に統合された中国語拡張品質分類器は、元の英語 GPT-3 分類器と同等のデータ保持率を維持し、多言語間の一貫性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。