Skip to main content
QUICK REVIEW

[論文レビュー] DeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing

Conglong Li, Zhewei Yao|arXiv (Cornell University)|Dec 7, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿では、効率的なデータサンプリングのためのスケーラブルなカリキュラム学習と、データルーティングのための新規のランダムレイヤワイズトークンドロップ(random-LTD)技術を組み合わせた、DeepSpeed Data Efficiencyというフレームワークを紹介する。これにより、GPT-3 1.3Bの事前学習において、ベースラインモデル品質の95%を維持しながら、データ量、時間、コストを最大12.5倍まで削減(Azure上では3.7Kドルまで)できる。

ABSTRACT

Recent advances on deep learning models come at the price of formidable training cost. The increasing model size is one of the root causes, but another less-emphasized fact is that data scale is actually increasing at a similar speed as model scale, and the training cost is proportional to both of them. Compared to the rapidly evolving model architecture, how to efficiently use the training data (especially for the expensive foundation model pretraining) is both less explored and difficult to realize due to the lack of a convenient framework that focuses on data efficiency capabilities. To this end, we present DeepSpeed Data Efficiency, a framework that makes better use of data, increases training efficiency, and improves model quality. Specifically, we propose and combine two data efficiency techniques: efficient data sampling via a general curriculum learning library, and efficient data routing via a novel random layerwise token dropping technique. For GPT-3 1.3B language model pretraining, our work achieves 12.5x less data/time/cost (\$3.7K if rent on Azure), while still maintaining 95% of model quality compared to baseline with full data and cost (\$46.3K). For GPT-3 1.3B and BERT-large pretraining, our work can also achieve the same model quality with up to 2x less data/time/cost, or achieve better model quality under same data/time/cost. DeepSpeed Data Efficiency is easy to use and tune, enabling us to easily apply it and verify its benefit on additional tasks including GPT-3 MoE model pretraining and small-scale GPT-2/ViT finetuning.

研究の動機と目的

  • 大規模ディープラーニングにおける増大する学習コストに取り組む。これは、モデルとデータの両方のスケーリングに起因する。
  • 既存のデータ効率技術の限界、たとえばスケーラビリティ、カスタマイズ性、学習パイプラインとの互換性の欠如を克服する。
  • NLPおよびビジョンモデルの事前学習および微調整の両方において、データサンプリングとルーティングを改善する統合的かつ拡張可能なフレームワークを開発する。
  • 特に基礎モデルの事前学習において、モデル品質を損なわず、データ量、時間、コストを大幅に削減することを可能にする。
  • ユーザーフレンドリーでPyTorch互換性を持つツールセットを提供し、データ効率戦略の簡単な統合とチューニングを可能にする。

提案手法

  • マップリダクスに基づく汎用カリキュラム学習(CL)ライブラリを導入し、大規模データセット全体にわたるスケーラブルでメトリクス駆動のデータ分析およびインデキシングを実現する。
  • カスタマイズ可能なCLベースのデータサンプラーとローダーを実装し、さまざまな難易度メトリクスと学習戦略をサポートする。
  • 各トランスフォーマーレイヤーでトークンの一部をスキップすることでFLOPsを削減する、データルーティング技術としてのランダムレイヤワイズトークンドロップ(random-LTD)を提案する。
  • モデルの安定性とパフォーマンスを保つようにレイヤワイズトークンドロップを設計し、特にGPTのような自己回帰的生成モデルにおいて有効である。
  • MSELG(Minimum Sample Loss Gradient)戦略を統合し、モデル損失に応じて動的にトークンドロップを調整することで、学習効率を向上させる。
  • PyTorchとの互換性を確保し、GPT-3、BERT-large、ViT、MoEアーキテクチャを含む多様なモデルをサポートする。

実験結果

リサーチクエスチョン

  • RQ1カリキュラム学習を大規模事前学習において、膨大なコード修正を伴わず、多様なデータサンプリング戦略をサポートするようにスケーラブルかつ一般化できるか?
  • RQ2random-LTDのようなデータルーティング技術が、TokenBypassなどの既存手法を上回る学習効率とモデル品質を達成できるか?
  • RQ3データ効率技術は、さまざまなモデルアーキテクチャにおいて、どの程度学習コストを削減できるか?同時にモデルパフォーマンスを維持または向上できるか?
  • RQ4データサンプリングとルーティング技術を組み合わせることで、実世界の事前学習シナリオにおいて、全体の学習効率とモデル品質にどのような影響を与えるか?
  • RQ5提案されたフレームワークは、MoEモデルや小規模な微調整を含む多様なタスクにおいて、容易に拡張・チューニング可能か?

主な発見

  • GPT-3 1.3Bの事前学習において、DeepSpeed Data Efficiencyは学習コストを46.3Kドルから3.7Kドルまで12.5倍削減し、ベースラインモデル品質の95%を維持した。
  • GPT-3 1.3BおよびBERT-largeの事前学習において、同じモデル品質を達成するのに最大2倍少ないデータ量、時間、コストで実現可能であり、同じ制約下ではより高いパフォーマンスを発揮した。
  • random-LTDは、すべてのテスト設定でTokenBypassを上回った:GPT-2の微調整およびGPT-3 350Mの事前学習において、同じトークン保存率でより低いパープレクシティを達成した。
  • MSLG統合により、random-LTDはViTモデルで1.3倍の学習スピードアップを達成し、わずかに精度が向上した。これは、EViT(1.15倍のスピードアップ)およびPeeling the Onion(1.15倍のスピードアップ)を上回った。
  • フレームワークは、MoEモデルの事前学習や小規模なGPT-2/ViTの微調整を含む多様なタスクにおいて、最小限のチューニングで一貫した改善をもたらした。
  • 汎用カリキュラム学習ライブラリにより、パイプラインの最小限の変更でスケーラブルかつカスタマイズ可能なデータサンプリングが可能となり、さまざまな難易度メトリクスにおける迅速な実験が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。