Skip to main content
QUICK REVIEW

[論文レビュー] Uncontrolled Lexical Exposure Leads to Overestimation of Compositional Generalization in Pretrained Models

Najoung Kim, Tal Linzen|arXiv (Cornell University)|Dec 21, 2022
Natural Language Processing Techniques被引用数 11
ひとこと要約

この論文は、事前学習中の制御不能な語彙露出によって、事前学習言語モデルが構成的一般化を過大評価していることを示している。COGSベンチマークの文脈に依存する語彙項目を、事前学習コーパスに存在しない新しい文字列や一意の埋め込みに置き換えることで、著者たちは顕著な性能低下を示した—最大51パーセンテージポイントの低下—これにより、以前の結果が事前学習データ内の希少語にさらされたことによって誇張されていたことが明らかになった。

ABSTRACT

Human linguistic capacity is often characterized by compositionality and the generalization it enables -- human learners can produce and comprehend novel complex expressions by composing known parts. Several benchmarks exploit distributional control across training and test to gauge compositional generalization, where certain lexical items only occur in limited contexts during training. While recent work using these benchmarks suggests that pretrained models achieve impressive generalization performance, we argue that exposure to pretraining data may break the aforementioned distributional control. Using the COGS benchmark of Kim and Linzen (2020), we test two modified evaluation setups that control for this issue: (1) substituting context-controlled lexical items with novel character sequences, and (2) substituting them with special tokens represented by novel embeddings. We find that both of these setups lead to lower generalization performance in T5 (Raffel et al., 2020), suggesting that previously reported results have been overestimated due to uncontrolled lexical exposure during pretraining. The performance degradation is more extreme with novel embeddings, and the degradation increases with the amount of pretraining data, highlighting an interesting case of inverse scaling.

研究の動機と目的

  • 事前学習中の制御不能な語彙露出が、構成的一般化ベンチマークで想定される分布的制御を無効にしているかどうかを調査すること。
  • COGSのようなベンチマークで、事前学習モデルが報告した高い一般化性能が、事前学習データ内の希少語彙項目への露出によって意図的に誇張されているかどうかを評価すること。
  • より厳密な語彙制御を実現する2つの修正された評価設定を提案・検証し、より信頼性の高い一般化スコアを得ること。
  • 語彙置換戦略の選択(文字列 vs. 新規埋め込み)がモデル性能および一般化の頑健性に与える影響を検討すること。
  • 事前学習が構成的一般化を均一に向上させるという仮定に疑問を呈すること、特に希少語彙項目を含むゼロショットまたはフェイントショット設定において。

提案手法

  • COGSベンチマークの文脈に依存する語彙項目(例:'hedgehog')を、事前学習コーパスに存在しない新しい文字列に置き換える。
  • 同じ語彙項目を、事前学習データと共有されていない、新しいランダムに割り当てられた埋め込みで初期化された特別なトークンに置き換える。
  • 同じ訓練および評価プロトコルを元のベンチマークと同一に保ち、T5モデルを2つの置換戦略の両方で、修正されたCOGSデータセット上で微調整する。
  • T5モデルが修正されたデータセット上で示す一般化精度を、元のCOGSベンチマークでの性能と比較する。
  • 性能低下を、制御不能な語彙露出による過大評価の指標として測定する。
  • 事前学習データ量のスケールが与える影響を評価するため、増加する事前学習データ量で微調整されたモデル間での性能低下を比較する。

実験結果

リサーチクエスチョン

  • RQ1事前学習中の制御不能な語彙露出が、事前学習モデルにおける構成的一般化の過大評価にどの程度寄与しているか。
  • RQ2文脈に依存する語彙項目を新しい文字列に置き換えることで、元のベンチマークと比較して一般化性能にどのような影響が生じるか。
  • RQ3語彙項目に新しいランダム初期化された埋め込みを使用した場合の一般化性能への影響は何か。また、文字列置換と比較してその影響はどのように異なるか。
  • RQ4性能低下の度合いは、事前学習データのスケールに応じて変化するか。その場合、事前学習が構成的一般化に果たす役割について何を示唆するか。
  • RQ5どのような条件下で、事前学習が構成的一般化を向上させないか、あるいはむしろ悪影響を及ぼすか。

主な発見

  • 文脈に依存する語彙項目を新しい文字列に置き換えることで、T5のCOGSにおける一般化精度は83%から64%〜69%に低下し、14〜19パーセンテージポイントの過大評価が示された。
  • 語彙項目に新しい埋め込みを使用した場合、性能低下は最大51パーセンテージポイントに達し、精度は83%から最低32%まで低下した。これは、制御不能な露出による深刻な過大評価を示している。
  • 新規埋め込み設定では、ランダム初期化されたモデルが事前学習済みモデルを上回る性能を示した。これは、語彙項目が適切に制御されていない場合、事前学習が一般化に悪影響を及える可能性があることを示唆している。
  • 新規埋め込みの使用は、文字列置換よりも性能低下が顕著であった。これは、事前学習データとの埋め込み類似度が過大評価の鍵要因であることを示している。
  • 性能低下の程度は、事前学習データ量の増加に伴い拡大し、より大きな事前学習データが過大評価を悪化させる逆スケーリング効果を示している。
  • これらの結果は、C4のような事前学習コーパス内の希少語彙項目への露出によって、事前学習モデルにおける強い構成的一般化の報告が誇張されている可能性が高いことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。