[論文レビュー] Structured Prompting: Scaling In-Context Learning to 1,000 Examples
この論文は、例をグループ化し、右寄せ位置埋め込みで個別に符号化し、再スケーリングされたアテンションを用いてすべての例示例に効率的に注目する方法である構造化プロンプティングを導入する。この手法により、計算量の複雑さを二次関数的から線形に削減し、従来の事例内学習よりも顕著に性能と安定性が向上する。
Large language models have exhibited intriguing in-context learning capability, achieving promising zero- and few-shot performance without updating the parameters. However, conventional in-context learning is usually restricted by length constraints, rendering it ineffective to absorb supervision from a large number of examples. In order to go beyond few shots, we introduce structured prompting that breaks the length limit and scales in-context learning to thousands of examples. Specifically, demonstration examples are separately encoded with well-designed position embeddings, and then they are jointly attended by the test example using a rescaled attention mechanism. So we can scale the number of exemplars with linear complexity instead of quadratic complexity with respect to length. Experimental results on a diverse set of tasks show that our approach improves end-task performance and reduces evaluation variance over conventional in-context learning as the number of demonstration examples increases. Code has been released at https://aka.ms/structured-prompting.
研究の動機と目的
- 従来の事例内学習では、コンテキストウィンドウの制限と二次関数的アテンションの複雑さのため、通常5~100例に制限されるが、これを克服する。
- 少数ショットの範囲を超えて例示例の数を拡大することで、事例内学習の安定性と性能を向上させる。
- パrameterの更新やファインチューニングなしに、多数の例示例に対して効率的な線形複雑度のアテンションを実現する。
- 少数ショットの事例内学習における例の順序や並び替えによる性能のばらつきを低減する。
提案手法
- N個の例示例をM個のグループに分割し、各グループを右寄せ位置埋め込みを用いたデコーダー専用のトランスフォーマーで個別に符号化する。これにより、テスト入力からの相対的距離が一貫する。
- 各グループの自己アテンションのキーやバリューをキャッシュし、推論時に効率的な検索を可能にする。
- テスト入力とグループ化された例示例との間のアテンションスコアを正規化する再スケーリングされたアテンション機構を用いる。これにより、コンテキストと入力の寄与度がバランスとられる。
- グループの符号化表現をテスト入力に連結し、トランスフォーマーのデコーダーを通過させて自己回帰的生成を行う。
- トリンケーション、アテンションマスク、またはパディングスペースといった異なるアライメント戦略を適用し、グループ化されたプロンプトをテスト入力に合わせる。BLOOMではトリンケーションが最も優れた結果を示した。
- グループ化の前に、入力-出力ペアを意味的に意味のある例示例に変換するための固定テンプレートを適用する。
実験結果
リサーチクエスチョン
- RQ1パrameterの更新やファインチューニングなしに、数千例の事例内学習を効果的にスケーリングできるか?
- RQ2多数の例示例を処理する際、アテンションの複雑さを二次関数的から線形に低下させることは可能か?
- RQ3例示例の数を増やすことで、事例内学習の性能と安定性が向上するか?
- RQ4アライメント戦略(例:トリンケーション、アテンションマスク)の中で、複数の例示例をグループ化する際、どの戦略がモデル性能を最もよく保持するか?
- RQ5多様なNLPタスクにおいて、構造化プロンプティングは従来の事例内学習と比べて、ばらつきと正確性の点でどのように異なるか?
主な発見
- 構造化プロンプティングは、テキスト分類、マルチチョイス、オープンエンド生成を含む複数のNLPタスクで最先端の性能を達成し、従来の事例内学習を上回る。
- BLOOM-7Bモデルでは、'トリンケーション'戦略を用いた構造化プロンプティングが、右寄せアラインメントなしの70.9%と比較して、タスク平均で72.5%の正確度を達成した。
- 例の順序の並び替えによる性能のばらつきが低減され、例の数が増えるにつれて一貫した向上が得られた。
- FairseqLM-6.7Bモデルでも、構造化プロンプティングは75.6%の平均正確度を達成し、異なるモデルサイズにおいても堅牢性を示した。
- 'トリンケーション'戦略は、常に他のアライメント手法を上回り、特にBLOOMでは、アテンションのバランスを最もよく保持していると考えられる。
- このアプローチにより、従来の事例内学習の典型的な5~100例の制限を大幅に超えて、最大1,000例の例をコンテキストに効果的に活用できるようになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。