[論文レビュー] It's Not Just Size That Matters: Small Language Models Are Also Few-Shot Learners
本稿では、パタン・エクスプロイティング・トレーニング(PET)の修正版を提案し、ALBERT などの小規模言語モデルが、パrameter数が3桁少ないにもかかわらず、GPT-3 と同等の少样本学習性能を達成可能にする。タスクを複数のパタンを用いた穴埋め形式の質問に再定式化し、ラベル付きデータに対する勾配ベースのファインチューニングを適用することで、計算コストと環境への影響を著しく削減した状態でSuperGLUEで最先端の結果を達成した。
When scaled to hundreds of billions of parameters, pretrained language models such as GPT-3 (Brown et al., 2020) achieve remarkable few-shot performance. However, enormous amounts of compute are required for training and applying such big models, resulting in a large carbon footprint and making it difficult for researchers and practitioners to use them. We show that performance similar to GPT-3 can be obtained with language models that are much "greener" in that their parameter count is several orders of magnitude smaller. This is achieved by converting textual inputs into cloze questions that contain a task description, combined with gradient-based optimization; exploiting unlabeled data gives further improvements. We identify key factors required for successful natural language understanding with small language models.
研究の動機と目的
- 大規模なパrameter数や過剰な計算リソースを必要とせずに、小規模言語モデルが少样本学習を実行できるようにすること。
- GPT-3 らような大規模モデルに代わる、より効率的な代替手段を採用することで、少样本NLPの環境的影響を低減すること。
- 構造化されたプロンプトとファインチューニングを用いた場合、小規模モデルがGPT-3 と同等の少样本一般化性能を達成できるかどうかを調査すること。
- パタンの多様性、語句の表現に対するロバストネス、ラベル付きデータの有効活用といった要因が、小規模モデルの高性能をもたらす鍵となる要因であるかを特定すること。
提案手法
- 出力が複数トークンに及ぶ状況に対応するため、PETを変更し、確率スコアに基づいてトークンを逐次予測する(最大確率優先デコード)デコード戦略を採用する。
- マスクド言語モデル(例:ALBERT)を用いて、穴埋め形式のプロンプトにおける候補回答の確率を計算する。入力は、穴埋め形式の質問に変換される。
- 複数のパタン(PVPs)を用いて入力・出力を再表現することで、多様な表現から学習し、一般化性能を向上させる。
- ラベル付き例を用いた勾配ベースのファインチューニングを実施し、より大きな教師モデルからの知識蒸留を活用して性能を向上させる。
- ラベルなしデータを自己学習の枠組みで活用し、特にラベル付きデータが限られる状況で性能をさらに向上させる。
- 予測を複数ラウンドにわたってパターン適用とモデル更新を繰り返すことで改善する反復的PET(iPET)を実装する。
実験結果
リサーチクエスチョン
- RQ1パラメータ数が莫大でない小規模言語モデルが、GPT-3 と同等の少样本学習性能を達成できるか?
- RQ2少样本学習における複数トークン出力予測を可能にするために、PETに必要な修正は何か?
- RQ3パタンの多様性、ラベル付けの効率性、モデルアーキテクチャといった要因が、小規模モデルの性能に与える影響は何か?
- RQ4ラベルなしデータや知識蒸留は、小規模モデルの少样本学習性能をどの程度向上させ得るか?
- RQ5訓練例の選択が性能に顕著に影響を与えるか。また、GPT-3 のプロンプトベース手法と比較して、その影響は何か?
主な発見
- 修正版PET手法でファインチューニングされたALBERTモデルは、わずか32件の訓練例でSuperGLUEでGPT-3を上回り、平均87.1%の性能を達成したのに対し、GPT-3は65.4%であった。
- 修正版PET手法は、GPT-3のパラメータ数の0.1%(約1億対1750億)のモデルを用いて、SuperGLUEで最先端の結果を達成した。
- 最大確率優先デコードは、COPA や ReCoRD といったタスクにおいて、左から右へのデコードおよび並列デコード戦略を上回る性能を示した。
- 訓練データのランダムシードによって性能に顕著な差が生じており、少样本学習手法の比較において一貫した訓練セットの使用が重要であることが示された。
- 知識蒸留やラベルなしデータを用いなくても、ALBERTを用いたPETは強力な性能を発揮しており、最小限のデータと計算リソースでも有効であることが示された。
- 本手法は環境的影響を顕著に低減しており、1台のGPUで数時間で訓練を完了できるのに対し、GPT-3 は膨大な計算リソースを要した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。