[論文レビュー] Transcending Scaling Laws with 0.1% Extra Compute
この論文では、0.1%の追加計算コストで、自己回帰的言語モデル(PaLM)を継続的微調整することで、UL2Rという手法を提案する。UL2の目的関数を用いて微調整することで得られるU-PaLMモデルは、顕著なスケーリング法則の改善を達成し、540Bパラメータで計算コストを2倍に効率化するとともに、62Bや8Bといった小規模モデルでも、挑戦的なBIG-Benchタスクで顕著な能力の出現を実現する。
Scaling language models improves performance but comes with significant computational costs. This paper proposes UL2R, a method that substantially improves existing language models and their scaling curves with a relatively tiny amount of extra compute. The key idea is to continue training a state-of-the-art large language model (e.g., PaLM) on a few more steps with UL2's mixture-of-denoiser objective. We show that, with almost negligible extra computational costs and no new sources of data, we are able to substantially improve the scaling properties of large language models on downstream metrics. In this paper, we continue training PaLM with UL2R, introducing a new set of models at 8B, 62B, and 540B scale which we call U-PaLM. Impressively, at 540B scale, we show an approximately 2x computational savings rate where U-PaLM achieves the same performance as the final PaLM 540B model at around half its computational budget (i.e., saving $\sim$4.4 million TPUv4 hours). We further show that this improved scaling curve leads to 'emergent abilities' on challenging BIG-Bench tasks -- for instance, U-PaLM does much better than PaLM on some tasks or demonstrates better quality at much smaller scale (62B as opposed to 540B). Overall, we show that U-PaLM outperforms PaLM on many few-shot setups, i.e., English NLP tasks (e.g., commonsense reasoning, question answering), reasoning tasks with chain-of-thought (e.g., GSM8K), multilingual tasks (MGSM, TydiQA), MMLU and challenging BIG-Bench tasks. Finally, we provide qualitative examples showing the new capabilities of U-PaLM for single and multi-span infilling.
研究の動機と目的
- 最小限の追加計算コストで、大規模言語モデルのスケーリング法則を改善すること。
- モデルサイズやデータ量を増加させずに、大規模言語モデルに顕著な能力をもたらすこと。
- 追加のトレーニング量を最小限に抑えながら、PaLMの機能を、マルチスパン埋め込みなどの新しいプロンプティングモードへと拡張すること。
- 多様な事前学習目的が、標準的な自己回帰的言語モデルとは異なる性能向上と新機能の実現に寄与することを示すこと。
提案手法
- PaLMという最先端の自己回帰的言語モデルを、UL2の混合ノイズ除去目的関数を用いて継続的微調整する。この目的関数は、プレフィックス言語モデル化とスパン破損(埋め込み)タスクを統合する。
- 推論時に、モデルの動作を制御するためのモード固有トークン([NLU]、[NLG]、[S2S])を用いる。
- ノイズ除去目的の組み合わせで学習する:R-ノイズ除去器(スパン破損)、X-ノイズ除去器(異なるスパンパターンを用いたスパン破損)、S-ノイズ除去器(プレフィックス言語モデル化)。
- 推論時に、複数のスパンを一度のプロンプトで埋め込めるように、埋め込み用の追加IDトークンを導入する。
- UL2の目的関数を、追加のFLOPs(約元のトレーニングの0.1%)でPaLMのチェックポイントに適用し、モデル重みを保持し、新たなデータを必要としない。
- PrefixLMとスパン破損の目的関数を事前学習プロトコルに組み込むことで、双方向注意機構と埋め込み機能を実装する。
実験結果
リサーチクエスチョン
- RQ1わずかな追加計算コストが、大規模言語モデルのスケーリング挙動を顕著に改善できるか?
- RQ2ノイズ除去目的の混合が、かつては非常に大きなスケールに達するまで性能向上が見られなかったモデルに、顕著な能力をもたらすことができるか?
- RQ3埋め込みやプレフィックスモデリングのような多様な目的で継続的微調整を施すことで、自然言語処理、推論、多言語タスクにおける下流のfew-shot性能が向上するか?
- RQ4アーキテクチャの変更なしに、1つのモデルが複数のプロンプティングモード(例:埋め込み、NLU、NLG)をサポートできるか?(モードトークンと追加IDトークンのみで。)
- RQ5自己回帰的言語モデルとして学習されたモデルが、最小限の計算コストで双方向的かつマルチスパン生成をサポートできるよう、どの程度強化できるか?
主な発見
- U-PaLMは、PaLM 540Bと同等の性能を約半分の計算コストで達成し、約440万TPOv4時間の計算リソースを節約する。
- 540Bスケールで、U-PaLMは計算効率が2倍向上し、FLOPあたりの性能が実質的に2倍に向上する。
- 顕著なBIG-Benchタスクでは、PaLMが著しく低い性能を示す62Bおよび8Bスケールでも、U-PaLMが顕著な性能向上を示す。
- U-PaLMは、常識的推論、質問応答、チェーン・オブ・トゥークン推論(例:GSM8K)、多言語タスク(MGSM、TydiQA)、MMLUにおいて、PaLMを上回る性能を示す。
- マルチスパン埋め込みとモード制御プロンプティング(例:[S2S]、[NLU]、[NLG])をサポートしており、アーキテクチャの変更なしに多様で制御可能な生成が可能である。
- 定性的な例では、U-PaLMが複数のスパンを正しく埋め込み、特に複雑またはオープンエンドのプロンプトにおいてPaLMよりも正確で多様な出力を生成していることが示されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。