Skip to main content
QUICK REVIEW

[論文レビュー] The Transient Nature of Emergent In-Context Learning in Transformers

Aaditya K. Singh, Stephanie C. Y. Chan|arXiv (Cornell University)|Nov 14, 2023
Neural Networks and Applications被引用数 4
ひとこと要約

この論文は、トランスフォーマーにおける文脈内学習(ICL)が、訓練が進むにつれて消失する傾向があることを示している。訓練の初期段階ではICLが現れるが、損失が減少し続ける中で、最終的には重み内学習(IWL)に取って代わられる。著者らは、L2正則化を用いることでICLの安定化が可能であり、早期停止を伴わずに持続的ないンテキスト内学習を実現できる道筋が得られることを示している。

ABSTRACT

Transformer neural networks can exhibit a surprising capacity for in-context learning (ICL) despite not being explicitly trained for it. Prior work has provided a deeper understanding of how ICL emerges in transformers, e.g. through the lens of mechanistic interpretability, Bayesian inference, or by examining the distributional properties of training data. However, in each of these cases, ICL is treated largely as a persistent phenomenon; namely, once ICL emerges, it is assumed to persist asymptotically. Here, we show that the emergence of ICL during transformer training is, in fact, often transient. We train transformers on synthetic data designed so that both ICL and in-weights learning (IWL) strategies can lead to correct predictions. We find that ICL first emerges, then disappears and gives way to IWL, all while the training loss decreases, indicating an asymptotic preference for IWL. The transient nature of ICL is observed in transformers across a range of model sizes and datasets, raising the question of how much to "overtrain" transformers when seeking compact, cheaper-to-run models. We find that L2 regularization may offer a path to more persistent ICL that removes the need for early stopping based on ICL-style validation tasks. Finally, we present initial evidence that ICL transience may be caused by competition between ICL and IWL circuits.

研究の動機と目的

  • トランスフォーマーにおける文脈内学習(ICL)が、訓練中に持続的であるか一時的であるかを調査すること。
  • 訓練損失が減少し続ける中で、ICLが現れ、その後に消失する条件を特定すること。
  • 最適化ダイナミクスの結果、IWLがICLを漸近的に上回る理由を検討すること。
  • L2正則化のような正則化手法がICLを安定化させ、その一時性を防げるかどうかを評価すること。
  • トランスフォーマーの残差ストリームにおけるICLとIWL回路の間の競合の可能性を調査すること。

提案手法

  • 著者らは、ICLとIWLの両方が高い精度を達成可能な合成的でバースト性のあるfew-shot分類データセット上でトランスフォーマーを訓練した。
  • 訓練の各段階で独立してICLとIWLのパフォーマンスを測定するため、別々の評価ヘッドを用い、時間経過に伴う正確性の変化を追跡した。
  • 訓練損失をモニタリングし、複数のモデルサイズとデータ分布を用いて一般化可能性を評価した。
  • ICLの安定化効果を検証するために、訓練中にL2正則化を適用した。
  • 残差ストリームにおけるICLとIWL回路の競合を分析し、リソース制約がIWLの優位性をもたらすと仮説を立てた。
  • 実際のLLMに近い状況を想定し、言語モデルのトークン埋め込みへも拡張実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーにおける文脈内学習(ICL)は、漸近的に持続するのか、それとも訓練中に現れ、やがて消えるのか?
  • RQ2訓練損失が継続的に減少しているにもかかわらず、なぜICLが消失するのか?これは、最適化が進行しているにもかかわらずである。
  • RQ3ICLの一時性を説明する要因として、ICLと重み内学習(IWL)回路の間の競合が存在するのか?
  • RQ4L2正則化のような正則化手法がICLを安定化させ、その消失を防げるのか?
  • RQ5データ分布(例:バースト性、クラスの偏り)がICLの出現と一時性に与える影響はどの程度か?

主な発見

  • ICLは訓練の途中で現れるが、訓練損失が減少し続ける中で完全に消失することが確認された。これは、ICLが漸近的に好まれないことを示している。
  • 訓練が進むにつれて、IWLがICLを一貫して上回ることが確認された。これは、標準的な交差エントロピー訓練下でIWLが漸近的に好まれる傾向にあることを示している。
  • 複数のモデルサイズとデータセットでICLの一時性が観察された。これは、トランスフォーマーにおいて一般に見られる現象であることを示している。
  • L2正則化はICLの安定化に効果的であり、消失を防ぎ、早期停止を伴わず持続的ないンテキスト内学習を可能にした。
  • 結果から、残差ストリームにおけるICLとIWL回路の競合がICLの一時性の背後にある要因である可能性が示唆された。特に、ソフトアテンション機構の制限により、IWLが優位性を獲得することがある。
  • 予備的証拠として、正則化によりICLの一時性が緩和される可能性があるが、その代償としてIWLのパフォーマンスが低下することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。