Skip to main content
QUICK REVIEW

[論文レビュー] Transformers generalize differently from information stored in context vs in weights

Stephanie C. Y. Chan, Ishita Dasgupta|arXiv (Cornell University)|Oct 11, 2022
Neural Networks and Applications被引用数 11
ひとこと要約

この論文は、トランスフォーマーが重み内情報とコンテキスト内情報の両方でどのように一般化するかを調査し、小規模モデルでは例に基づく一般化が行われる一方、大規模言語モデルではコンテキストから強く規則に基づく一般化を示すことを発見した。これは、スケールと言語データの組み合わせ的構造が、規則的なコンテキスト内学習を可能にしていることを示唆している。また、規則に基づくデータでの事前学習も同様の行動を誘発するため、大規模言語モデルに特徴的な誘導的バイアスの出現が示唆される。

ABSTRACT

Transformer models can use two fundamentally different kinds of information: information stored in weights during training, and information provided ``in-context'' at inference time. In this work, we show that transformers exhibit different inductive biases in how they represent and generalize from the information in these two sources. In particular, we characterize whether they generalize via parsimonious rules (rule-based generalization) or via direct comparison with observed examples (exemplar-based generalization). This is of important practical consequence, as it informs whether to encode information in weights or in context, depending on how we want models to use that information. In transformers trained on controlled stimuli, we find that generalization from weights is more rule-based whereas generalization from context is largely exemplar-based. In contrast, we find that in transformers pre-trained on natural language, in-context learning is significantly rule-based, with larger models showing more rule-basedness. We hypothesise that rule-based generalization from in-context information might be an emergent consequence of large-scale training on language, which has sparse rule-like structure. Using controlled stimuli, we verify that transformers pretrained on data containing sparse rule-like structure exhibit more rule-based generalization.

研究の動機と目的

  • トランスフォーマーが重み内情報とコンテキスト内情報の両方から一般化する際の誘導的バイアスを理解すること。
  • 異なる学習制度における規則ベースと例に基づく一般化パターンの比較。
  • 自然言語データでの事前学習が、大規模モデルにおける規則ベースのコンテキスト内一般化を誘発するかどうか、そしてどのように誘発するかを調査すること。
  • モデルスケールとデータ構造が、コンテキスト内学習行動をどのように共同で形作るかを特定すること。
  • 特定の事前学習によって、例に基づくコンテキスト内一般化が克服可能かどうかを評価すること。

提案手法

  • 規則ベースと例に基づく一般化を区別するために、部分的露出パラダイムが用いられ、モデルは最小限の規則またはトレーニング例との類似性に基づいて保留された刺激を分類した。
  • 2つの特徴を持つ合成データセットを用いて、トランスフォーマーをスクラッチから訓練し、ラベルは1つの特徴(例:色または形状)に従って決定された。これにより、重み内とコンテキスト内学習の制御された比較が可能になった。
  • 事前学習済み言語モデル(例:LLaMA)を同じ部分的露出タスクで評価し、コンテキスト内一般化行動を評価した。
  • 「規則性(rule-ness)」は、予測に寄与する特徴(例:形状または色)に沿った分類精度の上昇として定量化された。
  • モデルサイズ、アーキテクチャの深さ、アテンションヘッド、トレーニングデータ分布を変化させることで、一般化様式に影響を与える要因を特定した。
  • 事前学習中に規則ベースの一般化を明示的に必要とする合成データセットの変種を設計し、そのようなデータがデフォルトの例に基づくバイアスを打ち破るかどうかをテストした。

実験結果

リサーチクエスチョン

  • RQ1制御された合成設定において、トランスフォーマーは重み内情報からコンテキスト内情報へ一般化する際、どのように異なるか?
  • RQ2スクラッチから訓練された小規模なトランスフォーマーにおけるコンテキスト内学習は、例に基づく一般化か、規則ベースの一般化か、どちらを優位に示すか?
  • RQ3大規模事前学習済み言語モデルは、どの程度までコンテキスト内情報から規則ベースの一般化を示すか?
  • RQ4規則ベースの合成データでの事前学習が、トランスフォーマーに規則ベースのコンテキスト内一般化を誘発できるか?
  • RQ5モデルスケールが、言語モデルにおける規則ベースのコンテキスト内一般化を可能にする上で果たす役割は何か?

主な発見

  • スクラッチから訓練されたトランスフォーマーでは、重み内からの一般化は完全に規則ベースである一方、コンテキスト内からの一般化は主に例に基づくものである。
  • 大規模事前学習済み言語モデル(例:7B〜70Bパラメータ)は、小規模モデルよりも顕著に規則ベースのコンテキスト内一般化を示し、モデルサイズが大きくなるほど「規則性(rule-ness)」が増加する。
  • 小規模言語モデル(1Bおよび7Bパラメータ)は、スクラッチから訓練されたモデルと同様に、ほぼ完全に例に基づくコンテキスト内学習を示す。
  • 規則ベースの分類を要請する合成データで事前学習された場合、トランスフォーマーはコンテキストから規則ベースの一般化を学習できることが示された。これは、例に基づくバイアスが本質的ではなく、克服可能であることを示している。
  • 大規模言語モデルにおける規則ベースのコンテキスト内一般化へのシフトは、おそらく自然言語データの組み合わせ的・規則的な構造とモデルスケールの両方が関与している。
  • コントロール条件のベースラインでは、モデルが色に沿って一般化する傾向があることが示されたが、これはスパarsな規則(例:形状)が予測に寄与する場合に打ち消される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。