Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and Evaluation

Marius Mosbach, Tiago Pimentel|arXiv (Cornell University)|May 26, 2023
Topic Modeling被引用数 6
ひとこと要約

本稿では、125M〜30BパラメータのOPTおよびPythiaモデルを用いて、少数ショット微調整(FT)と文脈内学習(ICL)の公平でモデルサイズを制御した比較を提示している。モデルサイズが同一の場合、FTはドメイン外データにおいてICLと同等に一般化することを発見し、従来のICLが本質的により頑健であるという主張に疑問を呈し、両手法がデータ、プロンプト設計、モデルスケールに対して極めて感受性が高く、不安定であることを強調している。

ABSTRACT

Few-shot fine-tuning and in-context learning are two alternative strategies for task adaptation of pre-trained language models. Recently, in-context learning has gained popularity over fine-tuning due to its simplicity and improved out-of-domain generalization, and because extensive evidence shows that fine-tuned models pick up on spurious correlations. Unfortunately, previous comparisons of the two approaches were done using models of different sizes. This raises the question of whether the observed weaker out-of-domain generalization of fine-tuned models is an inherent property of fine-tuning or a limitation of the experimental setup. In this paper, we compare the generalization of few-shot fine-tuning and in-context learning to challenge datasets, while controlling for the models used, the number of examples, and the number of parameters, ranging from 125M to 30B. Our results show that fine-tuned language models can in fact generalize well out-of-domain. We find that both approaches generalize similarly; they exhibit large variation and depend on properties such as model size and the number of examples, highlighting that robust task adaptation remains a challenge.

研究の動機と目的

  • モデルサイズなどの混同要因を排除することで、文脈内学習(ICL)が少数ショット微調整(FT)を上回るドメイン外一般化性能を示すという矛盾する主張を解消すること。
  • ICLとFTの間で観察された一般化ギャップが、微調整の本質的限界にあるのか、それとも先行研究における実験的設計上の欠陥にあるのかを調査すること。
  • モデルサイズ(125M〜30B)と少数ショットデータ設定(16例および128例)を変化させた場合の、FTおよびICLの安定性とパフォーマンスを評価すること。
  • プロンプト設計、データ選択戦略、モデルスケールが、両適応戦略の一般化行動に与える影響を評価すること。
  • 制御された条件下での実証的結果に基づき、FTまたはICLを効果的に使用する時期と方法についての実務的知見を提供すること。

提案手法

  • モデルサイズを制御変数とするために、125M〜30Bの複数のサイズのOPTおよびPythiaモデルを用いた。
  • 入力パターンと語彙変換子(verbalizers)を固定したパターンベース微調整(PBFT)を適用し、微調整プロセスを標準化した。
  • 16ショットのデモンストレーションと3種類のプロンプトパターン(minimal、gpt-3、eval-harness)を用いて、一貫性のあるICL設定を確保した。
  • RTEおよびMNLIデータセットで、10個のランダムなデータシードごとに訓練・評価を行い、安定性を評価した。
  • ドメイン内およびドメイン外のパフォーマンスに基づいてモデルチェックポイントを選択し、一般化の頑健性を評価した。
  • 性能差の統計的有意性を検出するために、Welchのt検定を用い、モデルサイズおよびデータ設定ごとにICLとFTの差を分析した。

実験結果

リサーチクエスチョン

  • RQ1モデルサイズが同一の場合、少数ショット微調整はドメイン外データにおいて文脈内学習と同等に一般化するか?
  • RQ2モデルサイズは、微調整および文脈内学習の一般化パフォーマンスにどのように影響するか?
  • RQ3少数ショット例の数(16例対128例)は、両適応戦略の安定性とパフォーマンスにどのような役割を果たすか?
  • RQ4微調整および文脈内学習は、プロンプト設計およびデータ選択戦略に対してどの程度感受性を示すか?
  • RQ5従来観察されたICLの微調整上回る優位性は、本質的利点に起因するのか、それともモデルサイズの不均衡に起因する実験バイアスに起因するのか?

主な発見

  • モデルサイズが同一の場合、少数ショット微調整はドメイン外データにおいて文脈内学習と同等に一般化する。これは、ICLが本質的により頑健であるという従来の主張に反する。
  • 6.7Bモデルを用いた微調整は、16例のみを用いても30Bモデルを用いた文脈内学習と同等のパフォーマンスを達成した。これは、モデルスケールが先行比較に強く影響していることを示している。
  • 両手法とも、ランダムシードごとに高い不安定性を示し、ドメイン内およびドメイン外のパフォーマンスに顕著なばらつきが見られた。
  • 両手法のパフォーマンスはモデルサイズが大きくなるにつれて向上し、テストしたモデルおよびデータセットにおいて、微調整は文脈内学習よりも一般化性能が優れていることがしばしば見られた。
  • プロンプトパターンやデータ選択戦略(例:ドメイン内最良 vs. ドメイン外最良のチェックポイント)の選択が、特に微調整においてパフォーマンスに顕著な影響を与える。
  • 16例を用い、最適なチェックポイントを選択した場合、RTEデータセットにおいてほとんどのモデルサイズでICLとFTの間には統計的に有意なパフォーマンス差が認められず、公平な条件下で一般化性能が同等であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。