Skip to main content
QUICK REVIEW

[論文レビュー] Causal Transformers Perform Below Chance on Recursive Nested Constructions, Unlike Humans

Yair Lakretz, Théo Desbordes|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling被引用数 5
ひとこと要約

本研究では、最先端のTransformer言語モデルが、人間と同等に再帰的・ネストされた文法構造を処理できるかどうかを評価する。短距離の埋め込み依存関係ではほぼ完璧な性能を示すが、長距離の埋め込み依存関係では、3語の介詞句が追加されると著しく性能が低下し、下限以下の性能を示す。これは、再帰的かつ構造に敏感な処理において、顕著な脆さを示しており、RNN-LMにおける先行研究の結果と類似している。

ABSTRACT

Recursive processing is considered a hallmark of human linguistic abilities. A recent study evaluated recursive processing in recurrent neural language models (RNN-LMs) and showed that such models perform below chance level on embedded dependencies within nested constructions -- a prototypical example of recursion in natural language. Here, we study if state-of-the-art Transformer LMs do any better. We test four different Transformer LMs on two different types of nested constructions, which differ in whether the embedded (inner) dependency is short or long range. We find that Transformers achieve near-perfect performance on short-range embedded dependencies, significantly better than previous results reported for RNN-LMs and humans. However, on long-range embedded dependencies, Transformers' performance sharply drops below chance level. Remarkably, the addition of only three words to the embedded dependency caused Transformers to fall from near-perfect to below-chance performance. Taken together, our results reveal Transformers' shortcoming when it comes to recursive, structure-based, processing.

研究の動機と目的

  • 最先端のTransformer言語モデルが、再帰的・ネストされた文法構造の処理においてRNN-LMを上回るかを調査すること。
  • 数一致タスクにおける短距離と長距離の埋め込み依存関係の間でのモデル性能の違いを比較すること。
  • Transformerが再帰的構造において、RNN-LMと同様の処理の脆さを示すかどうかを検証すること。
  • モデルの誤りパターンが、マークドネス効果のような人間の言語的バイアスと一致するか、または乖離するかを検討すること。
  • 最小限の文法的複雑さ(例:3語の介詞句の追加)が、再帰的依存関係の処理性能に著しい悪影響を及えるかどうかを評価すること。

提案手法

  • 2つの文法的タスク(Short-NestedおよびLong-Nested構造)に対して、4つの事前学習済みTransformer言語モデル(GPT2-XL, GPT2-Large, GPT2-Medium, GPT2)を評価した。
  • 主語と動詞の間で数の一致を要請する埋め込み依存関係を有する文のペアを設計し、条件ごとに単数/複数の文法的数を変化させた。
  • 主(外側)および埋め込み(内側)の依存関係における一致意思決定の誤差率を測定することで、モデルの性能を測定した。
  • モデル間およびタスク間での性能を比較し、特に主語が単数で動詞が複数(または逆)となる不一致条件を焦点に、バイアスと一般化能力を評価した。
  • 埋め込み依存関係に3語の介詞句を追加した際の性能の変化を分析し、最小限の文法的変更が与える影響を評価した。
  • 人間の性能ベンチマーク(先行研究から得たもの)を用いて、モデルの行動を文脈づけ、特にマークドネス効果との関連を検討した。

実験結果

リサーチクエスチョン

  • RQ1Transformer言語モデルは、再帰的・ネストされた文法構造においてRNN-LMを上回るか?
  • RQ2再帰的構造における短距離と長距離の埋め込み依存関係の間で、モデルの性能はどのように変化するか?
  • RQ3埋め込み依存関係に最小限の文法的変更(例:介詞句の追加)が加えられた場合、モデルの性能はどのように変化するか?
  • RQ4Transformerは、再帰的処理においてRNN-LMと同様の誤りパターンを示すか、特に埋め込み依存関係で下限以下の性能を示すか?
  • RQ5モデルの誤りパターンは、マークドネス効果のような人間の言語的バイアスとどの程度一致するか、または乖離するか?

主な発見

  • 短距離の埋め込み依存関係では、すべての条件下で誤差率がほぼゼロに近く、Transformerはほぼ完璧な性能を示した。
  • 長距離の埋め込み依存関係では、Transformerの誤差率が下限を下回り、特にPSP条件(複数主語+単数動詞)で顕著な失敗を示した。
  • 埋め込み依存関係にたった3語(例:'near the cabinet')を追加するだけで、性能がほぼ完璧な状態から下限以下の水準に急低下した。
  • すべてのモデル(TransformerおよびLSTMを含む)が、主語が単数のときにより多くの誤りを犯す傾向を示しており、これはマークドネス効果を反映していた。
  • 主(より長い)依存関係の性能は下限を上回っており、長さそのものが再帰的ネストほど深刻な障害とはならないことが示された。
  • 多くのNLPタスクで優れた性能を示す一方で、Transformerは再帰的かつ構造に敏感な依存関係の処理において、顕著な脆さを示しており、これはRNN-LMの欠陥と類似している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。