[論文レビュー] Frequency Explains the Inverse Correlation of Large Language Models' Size, Training Data Amount, and Surprisal's Fit to Reading Times
本稿は、より大きな言語モデル(LLM)やより多くのデータで訓練されたモデルが、その予測の驚異度(surprisal)と人間の読解時間の間の適合度が低下する理由を、語彙頻度が鍵要因であると特定している。4つのモデルファミリーとコーパスを対象とした分析を通じて、より大きなモデルが希少語に過剰に適合し、人間の読解行動の予測を悪化させる、超人的に複雑な関連性を学習することで、特に希少語の予測が悪化することを示している。
Recent studies have shown that as Transformer-based language models become larger and are trained on very large amounts of data, the fit of their surprisal estimates to naturalistic human reading times degrades. The current work presents a series of analyses showing that word frequency is a key explanatory factor underlying these two trends. First, residual errors from four language model families on four corpora show that the inverse correlation between model size and fit to reading times is the strongest on the subset of least frequent words, which is driven by excessively accurate predictions of larger model variants. Additionally, training dynamics reveal that during later training steps, all model variants learn to predict rare words and that larger model variants do so more accurately, which explains the detrimental effect of both training data amount and model size on fit to reading times. Finally, a feature attribution analysis demonstrates that larger model variants are able to accurately predict rare words based on both an effectively longer context window size as well as stronger local associations compared to smaller model variants. Taken together, these results indicate that Transformer-based language models' surprisal estimates diverge from human-like expectations due to the superhumanly complex associations they learn for predicting rare words.
研究の動機と目的
- より大きな言語モデルや、より多くのデータで訓練されたモデルが、その驚異度推定と人間の読解時間の間の適合度が低下する理由を調査すること。
- 語彙頻度が、モデルサイズ/訓練データ量と驚異度の予測力の逆相関関係をどのように調節するかを特定すること。
- 訓練のダイナミクスとモデルアーキテクチャが、希少語と頻度の高い語の予測に与える影響を検討すること。
- 大規模モデルが希少語に対して過剰に正確に予測するようになることが、人間の処理難易度をモデル化する能力を損なうかどうかを評価すること。
- 自然な読解状況下で、頻度効果と予測可能性効果が分離可能かどうかを検討すること。
提案手法
- 4つのトランスフォーマー基盤の言語モデルファミリー(例:GPT、BERTの変種)を、4つの自然主義的読解時間コーパス(Natural Stories、Dundee、GECO、Provo)で評価し、驚異度推定値を算出。
- モデルが予測する驚異度と観察された読解時間との残差誤差を、語彙頻度の分位数ごとに層別して計算。
- 訓練トークン数の増加に伴い、希少語の予測がどのように学習されるかを、モデルのバリエーションごとに訓練ダイナミクスを追跡。
- 特徴量の寄与度分析(例:勾配ベースやアテンションの除去)を用い、文脈ウィンドウ長さと局所的アテンション強度が希少語予測に与える寄与を隔離。
- 回帰モデルを用いて、頻度ベースの層別化の有無にかかわらず、驚異度推定値と読解時間の適合度を評価。
- モデルサイズ(小、中、大)と訓練データ量(最大2Bトークン)を変化させたバリエーションを比較し、サイズ効果とデータ効果を分離。

実験結果
リサーチクエスチョン
- RQ1モデルサイズと驚異度の読解時間への適合度の逆相関関係は、語彙頻度によって変化するか?
- RQ2訓練ダイナミクスは、異なるサイズのモデルバリエーションにおいて、希少語の予測学習にどのように影響するか?
- RQ3より大きなモデルが、より小さなモデルと比較して、希少語の表現をどれほど正確に学習するか?
- RQ4(例:文脈ウィンドウ長さ、アテンション強度などの)どのようなメカニズムが、大規模モデルにおける希少語予測の優位性を支えているか?
- RQ5言語モデルの驚異度と人間の読解時間の乖離は、希少語の頻度に無関係な複雑な関連性への過剰適合によって説明可能か?
主な発見
- モデルサイズと読解時間への適合度の逆相関は、最も頻度が低い語において最も強く、より大きなモデルが顕著に正確な驚異度推定値を生成する。
- より大きなモデルバリエーションは、希少語の予測をより正確に学習しており、特に後期の訓練段階で顕著で、これが人間の読解時間への適合度の低下を引き起こしている。
- 訓練ダイナミクスの分析から、すべてのモデルバリエーションが、顕著な露出(例:2Bトークンを超えて)を経てから希少語の予測を学習し始め、より大きなモデルはより速く高い正確性に到達することが分かった。
- 特徴量の寄与度分析により、より大きなモデルが希少語をより正確に予測するのは、実効的な長い文脈ウィンドウと強い局所的アテンション関連性のおかげであると判明した。
- 超人的に複雑な関連性に起因する希少語に対する過剰な正確性が、驚異度推定が人間の処理期待と乖離する理由を説明している。
- 文脈ウィンドウのサイズを制限する、または局所的関連性を弱める処理を施すと、驚異度と読解時間の適合度が向上し、希少語のパターンへの過剰適合が人間の処理予測を損なうことを確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。