Skip to main content
QUICK REVIEW

[論文レビュー] Open Sesame: Getting Inside BERT's Linguistic Knowledge

Yongjie Lin, Yi Chern Tan|arXiv (Cornell University)|Jun 4, 2019
Neurobiology of Language and Bilingualism参考文献 27被引用数 15
ひとこと要約

この論文は、診断分類器と新規の注目に基づく誤りスコアメトリクスを組み合わせることで、BERTが文構造をどのように符号化しているかを調査している。BERTは、下位層では線形的・位置的な情報を符号化するが、上位層に進むにつれて、徐々に抽象的で階層的な文法的表現に移行しており、自己注意メカニズムは主語・動詞の一致や反映代名詞に敏感であるが、完全な人間のようなカテゴリー的正確性までは達していないことが判明した。

ABSTRACT

How and to what extent does BERT encode syntactically-sensitive hierarchical information or positionally-sensitive linear information? Recent work has shown that contextual representations like BERT perform well on tasks that require sensitivity to linguistic structure. We present here two studies which aim to provide a better understanding of the nature of BERT's representations. The first of these focuses on the identification of structurally-defined elements using diagnostic classifiers, while the second explores BERT's representation of subject-verb agreement and anaphor-antecedent dependencies through a quantitative assessment of self-attention vectors. In both cases, we find that BERT encodes positional information about word tokens well on its lower layers, but switches to a hierarchically-oriented encoding on higher layers. We conclude then that BERT's representations do indeed model linguistically relevant aspects of hierarchical structure, though they do not appear to show the sharp sensitivity to hierarchical structure that is found in human processing of reflexive anaphora.

研究の動機と目的

  • BERTの表現が文法的構造と線形的な語順のどちらをどれだけ符号化しているかを理解すること。
  • BERTが主題-動詞の一致や反射代名詞のような階層的依存関係を捉えているかどうかを調査すること。
  • 自己注意が表面的な語順を越えて言語的構造を符号化する役割を評価すること。
  • 注目重みを用いて、BERTの文法的歪みへの感受性を定量化するための定量的メトリクスを開発すること。
  • BERTが位置情報から階層的符号化に移行するネットワークのどの層でその転換が起こるかを特定すること。

提案手法

  • BERT表現における線形的解決策と階層的解決策を区別するため、'刺激の貧困'のパラダイムに基づいて診断分類器を訓練した。
  • 自己注意重みに基づく誤りスコアメトリクスを提案し、一致および代名詞タスクにおける文法的干渉要因へのBERTの反応を定量化した。
  • 線形モデルを用いて、文法的構造(例:関係節 vs. 前置詞句)と文法的特徴の一致が誤りスコアに与える影響を分析した。
  • BERTのトランスフォーマーブロック全体にわたる層ごとの注目パターンを分析し、構造的符号化の進化を追跡した。
  • 異なる干渉要因タイプ(文法的にアクセス可能 vs. アクセス不可能、一致 vs. 不一致の特徴)における誤りスコアを比較し、注目メカニズムの選別性を評価した。
  • 構造的歪みを制御した状態で、主題-動詞一致および反射代名詞タスクのパフォーマンスを評価し、構造的感受性を隔離した。

実験結果

リサーチクエスチョン

  • RQ1BERTの表現が、階層的な文法的構造と線形的な語順のどちらをどれだけ符号化しているか。
  • RQ2BERTの注目メカニズムは、主題-動詞一致および反射代名詞タスクにおける文法的干渉要因にどのように反応するか。
  • RQ3BERTのどの層で、位置情報から階層的符号化に移行するか。
  • RQ4数や性といった文法的特徴が、一致および代名詞解消におけるBERTの注目パターンにどのように影響するか。
  • RQ5BERTの注目メカニズムは、関係節内に埋め込まれた構造的複雑さ(関係節 vs. 前置詞句)に感受性を示すか。

主な発見

  • BERTの下位層は強い位置的および逐次的情報を符号化しており、上位層に進むにつれてその影響が薄れる。
  • 上位層では、階層的文法的構造への感受性が増し、表現がより抽象的で構造指向的になる。
  • 誤りスコアメトリクスにより、BERTの注目は文法的構造に敏感であることが判明した:関係節内の干渉要因は前置詞句内のものよりも多くの誤りを引き起こした。
  • 文法的にアクセス可能な干渉要因はアクセス不可能なものよりも誤りを増加させ、特徴が一致する干渉要因はより強い影響を持つことから、文法的特徴に敏感であることが示された。
  • 主題-動詞一致および反射代名詞の両タスクにおける誤りスコアは、層の深さが増すにつれて減少し、文法的構造の段階的抽象化が示された。
  • 線形情報の劣化と一致する層4での誤りスコアの著しいピークは、表現の構成における転換点を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。