[論文レビュー] Why Does Surprisal From Larger Transformer-Based Language Models Provide a Poorer Fit to Human Reading Times?
本研究では、より大きな、低いパーセプルキティを持つトランスフォーマー基盤の言語モデルが、人間の読解時間の予測に poorly な予測値を生成する理由を調査する。GPT-Neo および OPT モデルを用いた回帰分析および残差誤差分析により、より大きなモデルは、特に固有名などのオープンクラス語に対して、訓練データの過剰記憶のため、読解時間を系統的に低予測することが判明。これは、パーセプルキティが向上する一方で、認知的妥当性が規模の拡大に伴い低下することを示唆している。
This work presents a detailed linguistic analysis into why larger Transformer-based pre-trained language models with more parameters and lower perplexity nonetheless yield surprisal estimates that are less predictive of human reading times. First, regression analyses show a strictly monotonic, positive log-linear relationship between perplexity and fit to reading times for the more recently released five GPT-Neo variants and eight OPT variants on two separate datasets, replicating earlier results limited to just GPT-2 (Oh et al., 2022). Subsequently, analysis of residual errors reveals a systematic deviation of the larger variants, such as underpredicting reading times of named entities and making compensatory overpredictions for reading times of function words such as modals and conjunctions. These results suggest that the propensity of larger Transformer-based models to 'memorize' sequences during training makes their surprisal estimates diverge from humanlike expectations, which warrants caution in using pre-trained language models to study human language processing.
研究の動機と目的
- より大きな、低いパーセプルキティを持つトランスフォーマー基盤の言語モデルが、人間の読解時間の予測に poorly な予測値を生成する理由を調査すること。
- GPT-2 以外の多様なモデルファミリーにおいても、モデル容量が高くなるほど予測適合度が悪くなるという直感に反する傾向が成立するかを検証すること。
- 残差誤差分析を通じて、より大きなモデルが人間の読解行動からどれほど逸脱しているかを特定する、特定の言語現象を同定すること。
- モデルサイズが処理モデルにおける認知的妥当性を損なうという、NLP分野における「より大きなモデルが良い」という一般的な仮定に挑戦すること。
- 心理言語学的モデリングにおいて、より信頼できるベースラインとして、より小さな事前学習済み言語モデルを使用すべきであると提唱すること。
提案手法
- 5つの GPT-Neo および 8つの OPT 変種を用いた、言語モデルのパーセプルキティと、人間の読解時間への予測適合度との関係を評価する回帰分析を実施。
- 観察された傾向の堅牢性を確保するため、2つの独立した自然主義的読解データセットを用いた。
- 語の品詞(名詞、形容詞、助動詞、接続詞など)に注目し、予測の系統的偏差を特定するため、残差誤差分析を実施。
- GPT-Neo 2.7B などの大きなモデルと、GPT-Neo 125M などの小さなモデルの予測値を比較し、モデルサイズが予測精度に与える影響を分離。
- 残差誤差内の言語的パターンを分析し、オープンクラス語(例:固有名)に著しく低予測が集中しているか、関係語に著しく高予測が集中しているかを特定。
- 非 GPT-2 アーキテクチャを含む、より広範なモデルカバレッジを用いて、Oh ら(2022)の先行研究を統計的厳密性をもって再現・拡張。
実験結果
リサーチクエスチョン
- RQ1複数のトランスフォーマー基盤言語モデルファミリーにおいて、パーセプルキティと人間の読解時間への適合度との間で、対数線形の正の関係が成立するか?
- RQ2より大きな言語モデルが低いパーセプルキティを持つにもかかわらず、なぜ人間の読解時間の予測に poorly な予測値を生成するのか?
- RQ3より大きなモデルとより小さなモデルの間で、どの言語的カテゴリーが予測のずれが最も顕著に現れるか?
- RQ4モデルが訓練シーケンスを過剰記憶することで、人間の処理期待と比較して、予測のずれがどの程度生じるか?
- RQ5より小さなモデルを用いることで、言語モデルのサプライズ値の認知的妥当性を向上させられるか?
主な発見
- 2つのデータセットにおいて、5つの GPT-Neo および 8つの OPT 変種について、言語モデルのパーセプルキティと人間の読解時間への適合度との間に、厳密に単調で正の対数線形関係が確認された。
- より大きなモデルは、固有名やその他のオープンクラス語の読解時間を系統的に低予測しており、モデルサイズが大きくなるほど低予測の度合いが増加した。
- 助動詞や接続詞などの機能語に対しては、補正的な高予測が観察され、処理負荷の推定に変化が生じていることが示唆された。
- オープンクラス語における読解時間の低予測は、これらの項目が訓練シーケンスを広範に記憶しているため、予測のサプライズ値が不自然に低く設定されていることが原因であると考えられる。
- これらの結果は、より大きなモデルが、低いパーセプルキティと優れた言語モデル性能を達成しているにもかかわらず、人間の処理難易度推定から逸脱していることを示している。
- これらの発見は、「より大きなモデルが良い」という仮定に疑問を呈し、認知モデリングにおいては、より小さな事前学習済みモデルをより信頼できるベースラインとして使用すべきであると提唱する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。