Skip to main content
QUICK REVIEW

[論文レビュー] Can Entropy Explain Successor Surprisal Effects in Reading?

Marten van Schijndel, Tal Linzen|arXiv (Cornell University)|Oct 26, 2018
Text Readability and Simplification参考文献 15被引用数 7
ひとこと要約

本研究では、読解における後続語の予測可能性が直前の語の注視時間に影響を与える『後続予測の驚き効果』が、読者の不確実性(エントロピーで測定)によって完全に説明可能かどうかを検証する。自己-paced readingコーパスを用いたLSTM言語モデルを用いて、エントロピーと後続予測の驚きが読解時間の独立した予測要因であることが判明。これは、不確実性のみがこれらの効果を説明できないことを示唆する。

ABSTRACT

Human reading behavior is sensitive to surprisal: more predictable words tend to be read faster. Unexpectedly, this applies not only to the surprisal of the word that is currently being read, but also to the surprisal of upcoming (successor) words that have not been fixated yet. This finding has been interpreted as evidence that readers can extract lexical information parafoveally. Calling this interpretation into question, Angele et al. (2015) showed that successor effects appear even in contexts in which those successor words are not yet visible. They hypothesized that successor surprisal predicts reading time because it approximates the reader's uncertainty about upcoming words. We test this hypothesis on a reading time corpus using an LSTM language model, and find that successor surprisal and entropy are independent predictors of reading time. This independence suggests that entropy alone is unlikely to be the full explanation for successor surprisal effects.

研究の動機と目的

  • Angeleら(2015)が提唱したように、読解における後続予測の驚き効果が読者の不確実性によって完全に説明可能かどうかを評価すること。
  • エントロピー(将来の語の期待される驚き)が、後続予測の驚き効果の背後にあるメカニズムとして機能するかどうかを検証すること。
  • 同じニューラル言語モデルから推定される場合、後続予測の驚きの予測力がエントロピーに還元可能かどうかを検討すること。
  • 不確実性推定における計算制約(例:語彙範囲の制限)が、エントロピーと読解時間の関係に与える影響を調査すること。
  • 読者が、エントロピー推定を全語彙とトップK語彙の両方で行った場合、複数の可能な継続語を同時に予測しているかどうかを検討すること。

提案手法

  • 自己-paced readingコーパスの各語に対して、LSTM言語モデルを用いて後続予測の驚きとエントロピーを計算。傍受視界効果を排除する。
  • エントロピーを、すべての可能な次に続く語の期待される驚きとして定義:$ H(w_t) = -\sum_{w_{t+1} \in V} P(w_{t+1}|w_{1...t}) \log P(w_{t+1}|w_{1...t}) $。
  • 同じモデル分布を用いて、後続予測の驚きを $ \text{surprisal}(w_{t+1}) = -\log P(w_{t+1}|w_{1...t}) $ として推定。
  • 読解時間をエントロピーと後続予測の驚きの両方の予測変数として線形回帰分析を実施。両者の独立した寄与を検証。
  • 語彙全体とトップK個の確率の高い継続語の両方でエントロピー推定値を比較し、計算制約の影響を評価。
  • 傍受視界効果を排除するため、自己-paced readingコーパスを用いて、言語的予測可能性と視覚的処理の影響を分離。

実験結果

リサーチクエスチョン

  • RQ1読解時間における後続予測の驚き効果は、エントロピーで測定される読者の不確実性によって完全に説明可能か?
  • RQ2同じ言語モデルから推定される場合、エントロピーと後続予測の驚きが読解時間の独立した予測要因となるか?
  • RQ3エントロピー推定をトップK個の確率の高い継続語に制限した場合、その予測力は後続予測の驚きに比べて弱まるか?
  • RQ4より多くの未来の語を含めたエントロピー推定では予測力が向上するか、それとも直近の1語に限定されるか?
  • RQ5エントロピーを制御した後でも、後続予測の驚きの残存寄与は、不確実性推定における処理制限によって説明可能か?

主な発見

  • エントロピーと後続予測の驚きが読解時間の独立した予測要因であることが判明。これは、後続予測の驚き効果が単に次の語に対する不確実性に起因するわけではないことを示唆する。
  • 語彙全体を対象としたエントロピー推定は、トップK個の確率の高い継続語に制限した場合よりも読解時間の予測力が強かった。
  • トップK個の継続語に制限した場合、エントロピーの予測力は低下したが、後続予測の驚きは依然として強い予測要因であった。これは、読者が広範な可能性のある継続語を考慮している可能性を示唆する。
  • エントロピーを制御した後でも後続予測の驚きが独立した寄与を示すことは、不確実性を超える追加の認知的メカニズムが効果に関与している可能性を示唆する。
  • エントロピーが単なる予測の驚きの代理変数であるという仮説に反し、読者が単に次の語の期待される不確実性を処理しているのではなく、より広範な文脈的予測を実行している可能性を支持する。
  • 語彙全体を対象とした不確実性推定がトップK推定を上回ることから、読者が多数の潜在的継続語を同時に予測している可能性が示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。