[論文レビュー] In-context Learning Distillation: Transferring Few-shot Learning Ability of Pre-trained Language Models
本論文は、少数ショット学習能力を大規模事前学習言語モデルから小規模な学生モデルに、文脈内学習と言語モデリングの目的関数を併用して最適化することで転送する知識蒸留フレームワーク、in-context learning distillation (ICL-D) を提案する。この手法は、LAMA および CrossFit ベンチマークで最先端の性能を達成し、教師モデルに比べて最大13.4倍小さく、3.6倍速く、かつ91.4%の性能を維持する学生モデルを実現する。
Given the success with in-context learning of large pre-trained language models, we introduce in-context learning distillation to transfer in-context few-shot learning ability from large models to smaller models. We propose to combine in-context learning objectives with language modeling objectives to distill both the ability to read in-context examples and task knowledge to the smaller models. We perform in-context learning distillation under two different few-shot learning paradigms: Meta In-context Tuning (Meta-ICT) and Multitask In-context Tuning (Multitask-ICT). Multitask-ICT performs better on multitask few-shot learning but also requires more computation than Meta-ICT. Our method shows consistent improvements for both Meta-ICT and Multitask-ICT on two benchmarks: LAMA and CrossFit. Our extensive experiments and analysis reveal that in-context learning objectives and language modeling objectives are complementary under the Multitask-ICT paradigm. In-context learning objectives achieve the best performance when combined with language modeling objectives.
研究の動機と目的
- リアルタイムおよびリソース制限のあるシステムにおける大規模事前学習言語モデルの高い計算コストと導入障壁を解消すること。
- 大規模教師モデルから小規模な学生モデルへの文脈内少数ショット学習能力の転送を可能にし、効率的なデプロイメントを実現すること。
- 特にマルチタスク少数ショット設定下で、文脈内学習能力が知識蒸留によって効果的に転送可能かどうかを調査すること。
- 少数ショット学習の蒸留において、文脈内学習と言語モデリングの目的関数がどのように相互に補完的役割を果たすかを探索すること。
- Meta-ICTを上回る性能を達成するが、計算コストが高くなるという特徴を持つ、新しい少数ショット学習パラダイム、Multitask In-context Tuning (Multitask-ICT) を提案すること。
提案手法
- 大規模教師モデルから小規模な学生モデルへの文脈内学習行動とタスク固有の知識を同時に蒸留する教師-学生フレームワーク、in-context learning distillation (ICL-D) を提案する。
- 入力-出力の例示(デモ)からタスクを推論する文脈内学習の目的関数と、言語モデリングの目的関数を組み合わせ、知識転送を強化する。
- Meta-ICT(多様なタスクでメタ学習された)と Multitask-ICT(複数の少数ショットタスクを同時にチューニングする)の2つの少数ショット学習パラダイムの下で、蒸留フレームワークを適用する。
- 推論前に複数のターゲットタスクの文脈内例示を用いてモデルを微調整する新しいパラダイム、Multitask-ICT を導入し、Meta-ICT よりも高い性能を達成する。
- 学生モデルの予測分布を教師モデルのソフトラベルからガイドする一方で、教師の隠れ表現を用いて知識転送を促進する。
- 二重目的の学習目的関数を採用:一つはデモに条件づけられた文脈内学習(目的)、もう一つは次トークン予測のための言語モデリング(目的)、両者を同時に最適化する。
実験結果
リサーチクエスチョン
- RQ1大規模事前学習言語モデルから小規模な学生モデルへの文脈内少数ショット学習能力は、知識蒸留によって効果的に転送可能か?
- RQ2蒸留過程において、文脈内学習目的関数と言語モデリング目的関数は、どのように相互に作用し、補い合うか?
- RQ3提案された Multitask-ICT パラダイムは Meta-ICT を上回る少数ショット学習性能を達成するか?また、その計算コストはどの程度か?
- RQ4メタ学習タスクの分布が Meta-ICT の性能に与える影響はどの程度か?また、蒸留はデータスパarsityを緩和できるか?
- RQ5言語モデリングの目的関数のみで蒸留を行う場合、文脈内学習に必要な知識は十分に転送可能か?それとも、文脈内学習の監視は不可欠か?
主な発見
- in-context learning distillation は、Meta-ICT および Multitask-ICT の両パラダイム下で、LAMA および CrossFit ベンチマークにおいて一貫して少数ショット性能を向上させる。
- Multitask-ICT は Meta-ICT よりも少数ショット学習の正確性が高く、しかし適応段階での計算量が著しく増加する。
- Multitask-ICT では、文脈内学習と言語モデリングの目的関数の組み合わせが最良の性能をもたらし、両者の補完的性質を示している。
- 言語モデリングの蒸留のみでは性能が著しく低く、Setting 3 でP@1がたった18.5%にとどまるため、文脈内学習の監視がなければ不十分であることが示された。
- 教師モデルの1/13.4にまで縮小された学生モデルが、Multitask-ICT の下で CrossFit で教師モデルの91.4%の性能を維持する。
- モデルサイズを93%まで削減すると、1.7倍の高速化と91.4%の性能維持が達成され、一部の小型モデルは教師モデルを上回ることすらある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。