Skip to main content
QUICK REVIEW

[論文レビュー] Does injecting linguistic structure into language models lead to better alignment with brain recordings?

Mostafa Abdou, Ana Valeria González|arXiv (Cornell University)|Jan 29, 2021
Topic Modeling参考文献 50被引用数 19
ひとこと要約

本稿では、構文的(UD, DM)および意味的(UCCA)形式的記法を用いたアテンションガイドにより、BERTに言語的構造を注入することで、fMRI脳記録との整合性を向上させる手法を提案する。Wehbe2014データセットでは、構造的バイアスをもつモデルが顕著に脳デコード性能を向上させ、特に内容語や構文的タスクにおいて顕著な効果を示した。一方、Pereira2018データセットでは結果が混合しており、タスクおよびデータ条件が有利な場合に構造的バイアスが神経表現の整合性を向上させることを示唆している。

ABSTRACT

Neuroscientists evaluate deep neural networks for natural language processing as possible candidate models for how language is processed in the brain. These models are often trained without explicit linguistic supervision, but have been shown to learn some linguistic structure in the absence of such supervision (Manning et al., 2020), potentially questioning the relevance of symbolic linguistic theories in modeling such cognitive processes (Warstadt and Bowman, 2020). We evaluate across two fMRI datasets whether language models align better with brain recordings, if their attention is biased by annotations from syntactic or semantic formalisms. Using structure from dependency or minimal recursion semantic annotations, we find alignments improve significantly for one of the datasets. For another dataset, we see more mixed results. We present an extensive analysis of these results. Our proposed approach enables the evaluation of more targeted hypotheses about the composition of meaning in the brain, expanding the range of possible scientific inferences a neuroscientist could make, and opens up new opportunities for cross-pollination between computational neuroscience and linguistics.

研究の動機と目的

  • 事前学習済み言語モデルにシンボリックな言語的構造を注入することで、言語理解時の人的脳活動との整合性が向上するかを調査すること。
  • 構文的および意味的記法(UD, DM, UCCA)によってガイドされたアテンションメカニズムが、より脳に類似した表現を生成するかを評価すること。
  • このような構造的バイアスが、脳デコードタスクおよびターゲットされた言語的プロービングタスクの両方の性能向上に寄与するかを評価すること。
  • コーパスのドメインおよびサイズなど、モデルと脳の整合性に影響を及ぼす可能性のある言語的およびデータ関連の交絡要因を特定すること。
  • 構造化されたNLPモデルを通じて、脳における意味の構成に関するより的を射ねた神経科学的仮説を可能にすること。

提案手法

  • UD(従属構文解析)、DM(最小再帰意味論)、UCCA(意味的従属形式論)からのアノテーションに従って、自己アテンションが従うように偏りをもたせる新しいアテンションガイド損失を用いてBERTを微調整する。
  • 各形式論にアノテートされたドメイン特化型テキストコーパス上でモデルを学習し、微調整中にアテンションヘッドをガイドする。
  • 両方のデータセット(Wehbe2014およびPereira2018)のfMRI記録と比較するため、ベースラインモデルおよびガイド付きモデルの文および語レベルの表現を抽出する。
  • モデル表現からfMRI活性パターンへの線形マッピングを学習することで脳デコードを実施し、相関係数またはF1スコアを用いて性能を評価する。
  • 構文的(例:主語・動詞一致)および意味的(例:意味タグ付け)能力を評価するためのプロービングタスクを実施する。
  • 内容語対機能語の違いや、コーパスサイズ、ドメイン、従属構造長さなどの交絡要因が性能に与える影響を分析する。

実験結果

リサーチクエスチョン

  • RQ1言語モデルに言語的構造を注入することで、人的fMRI脳記録との表現的整合性が向上するか?
  • RQ2アテンションをガイドする際に使用された言語的形式論(UD, DM, UCCA)の中で、どの形式論が最も強い脳整合性をもたらすか?
  • RQ3構造的バイアスは構文的および意味的プロービングタスクの性能にどのように影響を及ぼし、これは脳整合性と相関するか?
  • RQ4コーパスのドメインおよびサイズがモデルと脳の整合性に及ぼす交絡要因としての影響はどの程度か?
  • RQ5文レベルの集約によって構造的情報が失われるため、Pereira2018データセットでの性能が劣化していると解釈できるか?

主な発見

  • UDおよびDM形式論に基づくアテンションガイド付き微調整を施したモデルは、Wehbe2014データセットにおいて顕著に脳デコード性能が向上し、特に語レベルで顕著であった。
  • 向上効果は内容語に対して最も顕著であり、UDおよびDMベースラインモデルの性能低下は主に内容語のデコード精度の低下に起因していた。
  • Pereira2018データセットでは、文レベルでの向上は限定的であったが、平均プールド表現を用いた場合、ガイド付きモデルの優位性は消失した。これは、集約が構造的利点を隠蔽している可能性を示唆している。
  • 両方のデータセットにおいて、DMおよびUDでガイドされたアテンションを備えたモデルは、UCCAでガイドされたモデルよりも常に脳整合性で優れていたが、これはコーパスのドメインおよびサイズの交絡要因に起因する可能性がある。
  • 脳活動と最も整合性の高いモデルでは、構文的プロービングタスク(例:主語・動詞一致)のデコードスコアが一貫して高く、共通の構造的感受性を示していた。
  • 本研究では、コーパスのドメインおよびサイズが重要な交絡要因であることが判明した。ガイド付きモデルのデコードスコア順位は、トレーニングコーパスサイズ(DM > UD > UCCA)と相関しており、データ特性が構造的バイアスの有効性に顕著に影響していることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。