Skip to main content
QUICK REVIEW

[論文レビュー] Different kinds of cognitive plausibility: why are transformers better than RNNs at predicting N400 amplitude?

James A. Michaelov, Megan D. Bardolph|arXiv (Cornell University)|Jul 20, 2021
Topic Modeling参考文献 32被引用数 14
ひとこと要約

本研究では、変換器言語モデル(T-LM)が再帰的ニューラルネットワーク言語モデル(RNN-LM)よりもN400電位(意味処理の困難さの神経的サイン)を予測する理由を調査する。GPT-2と独自に開発したRNN(JRNN)を用いて、T-LMが意味的促進効果をよりよく捉え、文脈とターゲット語の意味的類似度との相関が顕著に強い surprisal スコアを示すことを示した。これは、変換器が人間の認知に類似した拡散活性化を内蔵的にモデル化している可能性を示唆する。

ABSTRACT

Despite being designed for performance rather than cognitive plausibility, transformer language models have been found to be better at predicting metrics used to assess human language comprehension than language models with other architectures, such as recurrent neural networks. Based on how well they predict the N400, a neural signal associated with processing difficulty, we propose and provide evidence for one possible explanation - their predictions are affected by the preceding context in a way analogous to the effect of semantic facilitation in humans.

研究の動機と目的

  • 変換器言語モデル(T-LM)が再帰的ニューラルネットワーク言語モデル(RNN-LM)よりもN400電位をよりよく予測するかどうかを明らかにすること、特に意味的促進との関連において。
  • T-LMがN400電位をよりよく予測する理由が、文脈とターゲット語の意味的類似度を捉える能力に起因するかどうかを調査すること、これは人間の意味的プリミングに類似している。
  • T-LMとRNN-LMのアーキテクチャ的差異(特に注意メカニズムと再帰的状態)が、surprisal予測における意味的促進の異なるパターンを生じるかどうかを評価すること。
  • 限局的作業記憶を持つRNN-LMが認知的により現実的であるという仮定に挑戦し、T-LMが意味的プリミングのような神経認知的現象をよりよくモデル化できることを示すこと。
  • 特に予測と意味的関連性によるN400調節に関して、人間の言語理解をモデル化するにあたり、異なるニューラルネットワークアーキテクチャの認知的妥当性を明確にすること。

提案手法

  • 同じテキストコーパス上でGPT-2言語モデルと独自に開発したJ字型RNN(JRNN)を訓練し、訓練データを同等に保つ。
  • 各モデルのN400関連 surprisal を、文脈を前提としたターゲット語の負の対数尤度として計算した。
  • 事前学習済み単語埋め込みのコサイン距離を用いて、ターゲット語と前件語との意味的類似度を計算した。
  • 線形混合効果モデルを用いて、surprisalと意味的類似度がEEGデータからのN400電位をどれほどよく予測できるかを検証した。
  • GPT-2とJRNNのsurprisalがN400電位をどれほどよく予測できるかを比較し、意味的に関連するか否かのターゲット語に注目した。
  • モデルのsurprisalと意味的類似度の相関を分析し、モデルが拡散活性化効果を内蔵的にエンコードしているかどうかを評価した。

実験結果

リサーチクエスチョン

  • RQ1変換器言語モデル(T-LM)のsurprisalは、RNN-LMのそれよりもN400電位をよりよく予測できるか?
  • RQ2T-LMとRNN-LMは、文脈とターゲット語の意味的類似度を指標として、意味的促進効果をどれほど捉えられるか?
  • RQ3T-LMとRNN-LMにおいて、surprisalと意味的類似度の間に有意な相関があるか?また、これはN400電位予測にどのように関連するか?
  • RQ4T-LMとRNN-LMのアーキテクチャ的差異が、N400調節のような神経認知的現象のモデル化における性能の相違を説明できるか?
  • RQ5注意メカニズムによる自己注意を介した内蔵的拡散活性化モデル化が、T-LMがRNN-LMよりも言語理解の特定の側面において認知的により妥当である理由になるか?

主な発見

  • GPT-2のsurprisalは、特に最高クローズ完了語に関連する語に対して、N400電位の予測においてJRNNのそれよりも顕著に優れていた。
  • GPT-2のsurprisalは、文脈とターゲット語の意味的類似度との逆相関が強く、T-LMが文脈の意味的情報を予測によりよく統合できていることを示した。
  • JRNNのsurprisalは、高クローズ文脈における意味的に関連するか否かのターゲット語を区別できず、意味的促進への感受性が低いことが示された。
  • 結果から、T-LMは注意メカニズムを通じて、明示的な設計がなくても拡散活性化効果を内蔵的にモデル化している可能性がある。
  • RNN-LMは作業記憶が限定的で、直感的に認知的により妥当であるとされる一方で、T-LMはN400反応における意味的プリミングのような神経認知的現象をよりよく捉えている。
  • これらの発見は、認知的妥当性が人間の作業記憶に類似したアーキテクチャにのみ基づいて評価されるべきではなく、意味的促進のような主要な神経認知的ダイナミクスを再現できる能力にも基づくべきであると示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。