[論文レビュー] Transformer-Based Language Model Surprisal Predicts Human Reading Times Best with About Two Billion Training Tokens
本研究では、変換器ベースの言語モデルにおける学習データサイズとモデル容量が、人間の読破時間予測における驚異度(surprisal)の能力に与える影響を調査する。その結果、約20億トークンのデータで訓練されたモデルからの驚異度推定が、人間の読破データに対して最も良好な適合を示すことが判明した。その後、過剰最適化のため性能が低下する。より小さいモデルでは、人間の予測行動を捉えるのに十分な容量が求められる「転換点」が明らかになった。
Recent psycholinguistic studies have drawn conflicting conclusions about the relationship between the quality of a language model and the ability of its surprisal estimates to predict human reading times, which has been speculated to be due to the large gap in both the amount of training data and model capacity across studies. The current work aims to consolidate these findings by evaluating surprisal estimates from Transformer-based language model variants that vary systematically in the amount of training data and model capacity on their ability to predict human reading times. The results show that surprisal estimates from most variants with contemporary model capacities provide the best fit after seeing about two billion training tokens, after which they begin to diverge from humanlike expectations. Additionally, newly-trained smaller model variants reveal a 'tipping point' at convergence, after which the decrease in language model perplexity begins to result in poorer fits to human reading times. These results suggest that the massive amount of training data is mainly responsible for the poorer fit achieved by surprisal from larger pre-trained language models, and that a certain degree of model capacity is necessary for Transformer-based language models to capture humanlike expectations.
研究の動機と目的
- 言語モデルの品質と驚異度の予測力の関係について、矛盾する報告を解消すること。
- 学習データ量とモデル容量を変化させた場合、驚異度推定が人間の読破時間にどの程度適合するかを調査すること。
- 驚異度の性能が人間の処理パターンから逸脱し始めるデータ量または容量の閾値が存在するかを特定すること。
- より小さいモデルが、誤差の低下が読破時間の適合性を悪化させる「転換点」を示すかどうかを検討すること。
提案手法
- モデル容量と学習データサイズを体系的に変化させた、Pythiaに基づく変換器言語モデルの複数バージョンを訓練した。
- 自己回帰的次単語予測を用いて、各モデルバージョンの異なる訓練段階で驚異度推定値を算出した。
- 自発的読み進み時間(Natural Stories コーパス)と、目が先に進むまでの時間(Dundee コーパス)という2つの行動データセットに対して、驚異度予測を評価した。
- 読破時間データを対数変換し、階層的線形回帰モデルを用いて、驚異度が読破時間の分散をどの程度説明できたかを評価した。
- 訓練の進行に伴い、モデルのパープレキシティとモデル適合度(ΔLL)の関係を追跡し、性能の転換点を特定した。
- モデルサイズと訓練段階を比較することで、データ量とモデル容量の影響を分離した。

実験結果
リサーチクエスチョン
- RQ1変換器ベースの言語モデルにおける驚異度が、人間の読破時間を最もよく予測するのは、どの訓練段階か?
- RQ2モデル容量は、言語モデルのパープレキシティと読破時間への適合度の関係をどのように緩和するか?
- RQ3より小さいモデルでは、パープレキシティが低下するにつれて読破時間への適合度が悪化する「転換点」が存在するか?
- RQ4大規模な事前学習モデルではパープレキシティと予測力の間に負の相関が見られるが、小さいモデルでは初期には正の相関が見られるのはなぜか?
- RQ5学習データ量が、モデルの驚異度と人間の処理困難度の乖離をどの程度駆動しているか?
主な発見
- 現在の主流の変換器ベースの言語モデルからの驚異度推定は、約20億トークンの学習データで訓練された後、人間の読破時間に最も良好な適合を示す。
- 20億トークンを超えてさらに訓練を進めるにつれ、予測適合度が低下し、過剰最適化によって驚異度が人間の期待と乖離していることが示された。
- より小さいモデルバージョン(例:2-3-192)は、収束時に「転換点」を示し、パープレキシティの継続的低下が読破時間への適合度を悪化させる。
- 2-3-192モデルバージョンは重要な閾値を示している:この容量未満では、モデルは人間の予測行動を効果的に学習できないが、これを超えると統計的パターンに過剰適合し始める。
- 大規模モデルでは、長期間の訓練を経て、パープレキシティとモデル適合度の間で単調に減少する負の関係が明確に現れ、過去の報告の逆相関を確認した。
- モデル容量は、パープレキシティと適合度の関係に顕著な影響を及ぼさない。すべてのバージョンが連続的な曲線に従うため、モデルが人間レベルの予測を超えて学習する際の共通のインダクティブバイアスがあると考えられる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。