[論文レビュー] CPM-2: Large-scale Cost-effective Pre-trained Language Models
CPM-2は、知識継承を活用して事前学習を高速化し、プロンプトチューニングにより微調整のストレージコストを削減し、InfMoE—動的オフロード推論ツールキット—を用いてMoEモデルの効率的な単一GPU推論を実現するコスト効率の高いパイプラインを提供する。このフレームワークにより、110億パラメータの双方向言語モデルと1980億パラメータのMoEバージョンを構築でき、汎用的言語理解タスクにおいてmT5を上回る性能を発揮しながら、計算コストとストレージコストを大幅に削減できる。
In recent years, the size of pre-trained language models (PLMs) has grown by leaps and bounds. However, efficiency issues of these large-scale PLMs limit their utilization in real-world scenarios. We present a suite of cost-effective techniques for the use of PLMs to deal with the efficiency issues of pre-training, fine-tuning, and inference. (1) We introduce knowledge inheritance to accelerate the pre-training process by exploiting existing PLMs instead of training models from scratch. (2) We explore the best practice of prompt tuning with large-scale PLMs. Compared with conventional fine-tuning, prompt tuning significantly reduces the number of task-specific parameters. (3) We implement a new inference toolkit, namely InfMoE, for using large-scale PLMs with limited computational resources. Based on our cost-effective pipeline, we pre-train two models: an encoder-decoder bilingual model with 11 billion parameters (CPM-2) and its corresponding MoE version with 198 billion parameters. In our experiments, we compare CPM-2 with mT5 on downstream tasks. Experimental results show that CPM-2 has excellent general language intelligence. Moreover, we validate the efficiency of InfMoE when conducting inference of large-scale models having tens of billions of parameters on a single GPU. All source code and model parameters are available at https://github.com/TsinghuaAI/CPM.
研究の動機と目的
- 大規模事前学習言語モデル(PLM)のトレーニングおよびデプロイに伴う高い計算コスト、ストレージコスト、推論コストを低減すること。
- 既存のPLMから得た知識を再利用することで、知識継承を用いて事前学習を高速化すること。
- 従来の微調整に代えてプロンプトチューニングを採用し、モデルパラメータの0.01%未満に留めるために、微調整のストレージコストを削減すること。
- 新規の動的オフロードフレームワーク、InfMoEを用いて、限られたハードウェア上でも大規模MoEモデルの効率的な推論を可能にすること。
- 双方向(中国語・英語)タスク向けに、高性能でコスト効率の良い2つのPLM、CPM-2(110億パラメータ)およびCPM-2-MoE(1980億パラメータ)を構築すること。
提案手法
- 知識継承は、事前学習段階で、以前に学習済みのPLMの重みを初期値として用いることで実施され、段階的プロセスに分けられる:中国語事前学習、双方向事前学習、MoE事前学習。
- 従来のフル微調整の代わりにプロンプトチューニングが用いられ、更新対象は学習可能なプロンプト埋め込みのみであり、タスク固有のパラメータがモデル全体の0.01%未満に抑えられる。
- InfMoEは、パラメータ移動と計算を重ねる動的スケジューリングを用いる高パフォーマンスでメモリ効率の良い推論フレームワークであり、数十亿パラメータのモデルを単一GPUで推論可能にしている。
- モデルアーキテクチャは、スパン予測に特化したマスク言語モデル目的を備えたハイブリッドエンコーダデコーダTransformerである。スパンは特別なトークンに置き換えられ、デコーダが予測する。
- MoEバージョンでは、ゲーティング機構を用いてトークンをスパースなエキスパートにルーティングし、評価時にエキスパートの使用がバランスされていることが確認され、効率的なスケーリングが可能である。
- トークン化は、発音ベースおよび漢字ベースの手法を強化しており、中国語NLPタスクにおいて、文字ベースのトークン化よりも耐性性と性能が優れている。
実験結果
リサーチクエスチョン
- RQ1既存のモデルを活用することで、知識継承が大規模PLMの事前学習にかかる時間と計算コストを顕著に削減できるか?
- RQ2ストレージコストを削減しつつ、下流タスクの性能を維持または向上させる観点で、フル微調整と比較してプロンプトチューニングはどの程度効果的か?
- RQ3InfMoEのような動的オフロード推論フレームワークは、数十亿パラメータの大きなMoEモデルを単一GPUで効率的に推論可能にするか?
- RQ4大規模PLMにおけるプロンプトの最適な配置と構造は何か? これにより下流タスクの性能を最大限に引き出せるか?
- RQ5非ユークリッド的アーキテクチャ、たとえば双曲トランスフォーマーは、より少ないパラメータで効率性と性能を向上させられるか?
主な発見
- CPM-2は、下流タスクにおける7つの具体的な言語能力で最先端の一般言語知能を達成し、mT5を上回る強力な性能を示した。
- 最適化されたプロンプト配置とハイブリッドプロンプト-微調整戦略を用いることで、単独で用いる場合よりも優れた性能が得られた。
- InfMoEにより、CPM-2-MoE(1980億パラメータ)を単一GPUで効率的に推論可能となり、計算時間とパラメータ移動のオーバーラップにより遅延が低減された。
- 知識継承により、既存のPLMからの初期化によって事前学習の時間とコストが削減され、中国語、双方向、MoEデータを段階的に事前学習することでトレーニングが加速した。
- 発音ベースおよび漢字ベースのトークン化手法は、中国語NLPタスクにおいて文字ベースのトークン化よりも耐性性と性能が優れていた。
- 双曲トランスフォーマーのフレームワークは、パラメータ数を半分にした状態で、ユークリッドトランスフォーマーと同等の性能を達成しており、将来的なより効率的なPLMアーキテクチャの可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。