Skip to main content
QUICK REVIEW

[論文レビュー] Large GPT-like Models are Bad Babies: A Closer Look at the Relationship between Linguistic Competence and Psycholinguistic Measures

Julius Steuer, Marius Mosbach|arXiv (Cornell University)|Nov 8, 2023
Topic Modeling被引用数 4
ひとこと要約

本研究では、ベビーLMコーパス上でGPT風の言語モデルを訓練し、言語的熟達度と心理言語的妥当性のトレードオフを検討した。大きなモデルは形式的・機能的言語的タスク(BLiMP、GLUE、MSGS)で性能を向上させるが、自己-paced読解時間の予測では逆に性能が低下し、最小のモデルが心理言語的データとの適合が最も良い結果を示した。これは、言語モデルのスケーリングと、発達的に妥当な方法での処理負荷のモデリングの間に根本的な不適合性があることを示唆している。

ABSTRACT

Research on the cognitive plausibility of language models (LMs) has so far mostly concentrated on modelling psycholinguistic response variables such as reading times, gaze durations and N400/P600 EEG signals, while mostly leaving out the dimension of what Mahowald et al. (2023) described as formal and functional linguistic competence, and developmental plausibility. We address this gap by training a series of GPT-like language models of different sizes on the strict version of the BabyLM pretraining corpus, evaluating on the challenge tasks (BLiMP, GLUE, MSGS) and an additional reading time prediction task. We find a positive correlation between LM size and performance on all three challenge tasks, with different preferences for model width and depth in each of the tasks. In contrast, a negative correlation was found between LM size and reading time fit of linear mixed-effects models using LM surprisal as a predictor, with the second-smallest LM achieving the largest log-likelihood reduction over a baseline model without surprisal. This suggests that modelling processing effort and linguistic competence may require an approach different from training GPT-like LMs on a developmentally plausible corpus.

研究の動機と目的

  • 発達的に妥当なコーパスで訓練された大規模GPT風言語モデルが、同時に高い言語的熟達度と認知的に妥当なモデル化を達成できるかどうかを調査すること。
  • モデルサイズと、形式的言語的熟達度タスク(BLiMP、GLUE、MSGS)および心理言語的測定(読解時間予測)におけるパフォーマンスの関係を評価すること。
  • LMの驚異度(surprisal)が実際に人間の読解時間と相関するかどうか、特にモデルサイズの違いに応じて検証すること。
  • 言語的熟達度と処理負荷のモデリングの間の観察された乖離が、将来の認知的に妥当な言語モデル設計に与える影響を検討すること。
  • ドメイン特化型の子供向けコーパス(例:ベビーLM)で学習させることで、大規模で一般ドメインのデータセットよりも人間の処理メカニズムに整合性をもたせられるかどうかを特定すること。

提案手法

  • ベビーLM事前学習コーパスの厳密版を用いて、パラメータ数が<500万から約1億の範囲でサイズが異なる一連のデコーダー専用トランスフォーマー言語モデルを訓練した。
  • 3つのベンチマークタスクでモデルを評価した:BLiMP(形式的言語的熟達度)、GLUE(機能的言語的熟達度)、MSGS(構文的一般化)。
  • 標準的なNLP指標(例:正答率、F1スコア)およびベビーLM開発セットにおけるPerplexityを用いてモデルのパフォーマンスを測定した。
  • 心理言語的妥当性を、LMの驚異度を予測変数として用いた線形混合効果モデルを適合させることで評価した。データはNatural Storiesコーパスの自己paced読解時間に基づいた。
  • モデルの適合度を、驚異度なしのベースラインモデルと驚異度ありのモデルとの間の対数尤度の差(Δlog-likelihood)で定量化した。Δlog-likelihoodが大きいほど、予測精度が高いことを示す。
  • Spearmanの順位相関を用いて、モデルサイズ、Perplexity、および言語的および心理言語的タスクにおけるパフォーマンスとの関係を分析した。

実験結果

リサーチクエスチョン

  • RQ1発達的に妥当なコーパスで訓練された場合、モデルサイズの増加がBLiMP、GLUE、MSGSといった形式的・機能的言語的熟達度ベンチマークでのパフォーマンス向上に寄与するか?
  • RQ2LMサイズと、LMの驚異度が人間の自己paced読解時間の予測にどの程度有効かとの相関関係は存在するか?
  • RQ3子供向けコーパスで訓練された大規模GPT風モデルは、同時に高い言語的熟達度と強い心理言語的妥当性を達成できるか?
  • RQ4言語モデルのサイズが、驚異度と実証的読解時間データとの適合度に影響を及ぼすか、その影響の仕組みは何か?
  • RQ5訓練コーパス(例:ベビーLM対Wikitext-103)の役割は、LMの驚異度と読解時間の相関関係を促進するか、あるいは阻害するか?

主な発見

  • 大きなGPT風モデルでは、BLiMP、GLUE、MSGSにおけるパフォーマンスがモデルサイズに正の相関を示し、モデルサイズが大きくなるにつれて性能が単調に向上した。
  • 500万パラメータ未満の小規模モデルが、自己paced読解時間データへの適合が最も良く、ベースラインモデルとの対数尤度差が最大であった。
  • モデルサイズと読解時間予測の適合度の間には負の相関が認められ、2番目に小さなモデルがΔlog-likelihoodの改善幅が最大であった。
  • LMのPerplexityと読解時間予測適合度との間にはSpearmanの順位相関が負であった(ρ = -0.4784、p < 0.05)、すなわち、低いPerplexityは人間の読解時間の予測精度が悪いことを示唆した。
  • ベビーLMコーパスはWikitext-103より小さかったが、驚異度と読解時間の相関がWikitext-103よりも良好であった。これは、コーパス固有の性質がこの学習を促進する可能性を示唆している。
  • 結果から、驚異度による処理負荷のモデリングと、言語的熟達度の達成は、標準的なGPT風事前学習とは根本的に異なる訓練方針やアーキテクチャ選択を要することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。