[論文レビュー] Instruction Induction: From Few Examples to Natural Language Task Descriptions
本論文は、少数の入力-出力例から自然言語の指示を生成する、大規模言語モデルが適用する新しいパラダイム「インstruct誘導」を紹介する。この手法により、ファインチューニングを経ずにゼロショットでタスク記述が可能となる。最高のモデル、InstructGPTは43.6%の実行精度を達成し、人間のパフォーマンスの43.6%に相当する。これは、インストラクション誘導が、誤った相関を低減し、モデルの透明性を向上させる強力な潜在能力を有する、実用的で解釈可能な学習パラダイムであることを示している。
Large language models are able to perform a task by conditioning on a few input-output demonstrations - a paradigm known as in-context learning. We show that language models can explicitly infer an underlying task from a few demonstrations by prompting them to generate a natural language instruction that fits the examples. To explore this ability, we introduce the instruction induction challenge, compile a dataset consisting of 24 tasks, and define a novel evaluation metric based on executing the generated instruction. We discover that, to a large extent, the ability to generate instructions does indeed emerge when using a model that is both large enough and aligned to follow instructions; InstructGPT achieves 65.7% of human performance in our execution-based metric, while the original GPT-3 model reaches only 9.8% of human performance. This surprising result suggests that instruction induction might be a viable learning paradigm in and of itself, where instead of fitting a set of latent continuous parameters to the data, one searches for the best description in the natural language hypothesis space.
研究の動機と目的
- 大規模言語モデルが自然言語を用いて、少数の例からその背後にあるタスクを明示的に推論・記述できるかどうかを調査すること。
- パrameterベースの学習の代替案としてのインストラクション誘導の可能性を検討し、自然言語に根ざした解釈可能性の向上を目的とすること。
- ファインチューニングやラベル付きの指示データなしで、正確で実行可能な指示を生成できる言語モデルの能力を評価すること。
- BERTScoreのような意味的類似度(BERTScore)と実行精度の両方を用いて、インストラクション誘導モデルの性能と人間が作成した指示を比較すること。
- 特にモデルサイズとインストラクションチューニングの観点から、インストラクション誘導が発現する条件を特定すること。
提案手法
- インストラクション誘導をゼロショットプロンプティングタスクとして定式化:少数の入力-出力ペアが与えられたとき、タスクを記述する自然言語の指示を生成する。
- 人間のパズル解決行動を模倣したメタプロンプトを用い、ファインチューニングなしでモデルをプロンプトする。
- 語彙・構文的性質、スタイル変換、センチメント分析を含む24の多様なNLPタスクからなるベンチマークデータセットを構築する。
- 2つの指標を用いて生成された指示を評価する:人間の基準との意味的類似度を測るBERTScoreと、機能的正しさを測る実行精度。
- 実行精度を測定する際、2番目のLMが提示された指示のみを使ってタスクを実行できるかどうかをテストすることで評価する。
- 小規模モデルおよび元のGPT-3を用いたアブレーションスタディを実施し、モデルサイズとインストラクションチューニングがインストラクション誘導を可能にする役割を特定する。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、少々の例の下で、入力-出力ペア間の関係を正確に記述する自然言語の指示を生成できるか?
- RQ2インストラクション誘導のパフォーマンスは、多様なNLPタスクにおいてどのように変動するか。また、どのタスクがこのパラダイムに最も適しているか?
- RQ3モデルサイズとインストラクションチューニングは、インストラクション誘導の能力にどの程度影響を与えるか?
- RQ4実行精度は、BERTScoreのような意味的類似度指標と比較して、指示品質の評価においてどのように優れているか?
- RQ5インストラクション誘導は、従来のパrameterベースの学習の代替として実用的であると言えるか。特に、誤った相関を低減し、解釈可能性を向上させる点で?
主な発見
- InstructGPTは、インストラクション誘導ベンチマークで43.6%の実行精度を達成し、人間パフォーマンスの65.7%に相当する。これは、実行可能な指示を生成する上で、強力な機能的正しさを示している。
- 元のGPT-3モデルは、実行精度指標で人間パフォーマンスのたった9.8%にとどまり、インストラクションチューニングなしではインストラクション誘導の能力を有しないことが示された。
- InstructGPTはBERTScoreで44.4を達成したが、人間パフォーマンスの60.0に比べてまだ及ばない。生成された指示は人間の基準に意味的に近くはあるが、同等ではない。
- フォーマルなスタイル変換や意味的テキスト類似度のタスクでは、InstructGPTは機能的に正しい、人間と同等の指示を生成できており、例として「入力をよりフォーマルな言語に翻訳してください」といった表現を含む。
- インストラクション誘導は、モデルアーキテクチャとチューニングに強く依存する。小規模なInstructGPTバージョンや元のGPT-3は意味のある指示を生成できない。これは、インストラクションチューニングとスケーリングが不可欠であることを示唆している。
- 「各入力に対して出力を出力してください」といった汎用的・空っぽな指示はBERTScoreを高めるが、実行精度では失敗する。これは、実行精度が優れた評価指標であることを強力に示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。