Skip to main content
QUICK REVIEW

[論文レビュー] Do Neural Models Learn Systematicity of Monotonicity Inference in Natural Language?

Hitomi Yanaka, Koji Mineshima|arXiv (Cornell University)|Apr 30, 2020
Natural Language Processing Techniques参考文献 40被引用数 5
ひとこと要約

この論文は、神経ネットワークモデルが単調性推論において体系的な一般化を学習するかを評価する。具体的には、量化子、述語、埋め込み文の未観測な組み合わせにおける含意関係の推論能力を対象とする。構文的・意味的変化を制御した合成データセットを用いて、モデルの一般化能力を検証した結果、テスト構造が訓練時とほぼ同一である場合にのみ一般化が達成され、わずかな構文的変更に対しても失敗することが判明。これは、記憶に依存する一般化を超えた構成的一般化が限定的であることを示唆している。

ABSTRACT

Despite the success of language models using neural networks, it remains unclear to what extent neural models have the generalization ability to perform inferences. In this paper, we introduce a method for evaluating whether neural models can learn systematicity of monotonicity inference in natural language, namely, the regularity for performing arbitrary inferences with generalization on composition. We consider four aspects of monotonicity inferences and test whether the models can systematically interpret lexical and logical phenomena on different training/test splits. A series of experiments show that three neural models systematically draw inferences on unseen combinations of lexical and logical phenomena when the syntactic structures of the sentences are similar between the training and test sets. However, the performance of the models significantly decreases when the structures are slightly changed in the test set while retaining all vocabularies and constituents already appearing in the training set. This indicates that the generalization ability of neural models is limited to cases where the syntactic structures are nearly the same as those in the training set.

研究の動機と目的

  • 深層ニューラルネットワークが自然言語における単調性推論のパターンを体系的に一般化できるかを調査すること。
  • 未観測な量化子、述語、埋め込み文構造の組み合わせに対して、モデルの一般化能力を評価すること。
  • 一般化の失敗における構文的構造の役割を、語彙的および意味的変化から分離して同定すること。
  • MultiNLI などの大規模 NLI データセットと比較して、合成データで訓練されたモデル(例:BERT)の性能を評価すること。
  • 合成単調性データで事前学習することで、標準ベンチマーク(例:MultiNLI)の性能を損なわずに一般化能力が向上するかを同定すること。

提案手法

  • 単調性推論をテストするため、量化子、述語、埋め込み文の深さに体系的な変化を加えた制御されたデータセットを合成した。
  • 4つの評価軸を設計:述語置換の体系的変化、量化子の埋め込み、文の深さにおける生産性、局所性。
  • 構文的構造のみを変化させた、3つのニューラルモデル(BERT を含む)を合成データで訓練し、訓練・テスト分割を制御した。
  • 未知の構成のテストで一般化を評価した。語彙や構成要素は訓練時と同一であったが、構文的構造が異なっていた。
  • 合成データと MultiNLI を混合して、現実世界の推論パターンと合成推論パターンの間での性能のトレードオフを評価した。
  • 主タスクとして含意予測を採用し、未知の構文的構成における正確性を測定した。

実験結果

リサーチクエスチョン

  • RQ1構文的構造が維持される場合に、神経ネットワークモデルは未観測な量化子と述語の組み合わせに対し、体系的に一般化できるか?
  • RQ2語彙と構成要素は同一でも、テスト文の構文的構造が訓練文とわずかに異なる場合、性能はどの程度低下するか?
  • RQ3訓練時に浅い深さ(例:深さ2)の埋め込み文しか学習していないモデルが、より深い深さ(例:深さ3)の埋め込み文に対し、どの程度一般化できるか?
  • RQ4合成単調性データで事前学習することで、MultiNLI のような標準的な NLI ベンチマークの性能を損なわずに一般化能力が向上するか?
  • RQ5モデルは、特に下向き含意文脈において、構成的推論ではなく表面的ヒューリスティクスに依存しているのだろうか?

主な発見

  • モデルは、テスト文の構文的構造が訓練データとほぼ同一である場合にのみ体系的な一般化を達成し、わずかな構造的変更では失敗した。
  • 構成要素の順序や文の埋め込み深さが異なる場合でさえ、語彙と構成要素が同一でも性能が著しく低下した。
  • 訓練データに深さ2の埋め込み文しか含まれないモデルは、深さ3の埋め込み文に対し一貫して一般化できず、生産性の一般化が不十分であることが判明した。
  • 合成単調性データで微調整した BERT は、合成テストセットで性能が向上した一方で、MultiNLI での正確性は維持されており、二重の能力を示した。
  • MultiNLI ではモデルがヒューリスティクス的行動を示し、特に下向き含意の文脈では、前提に含意されていない長文の仮説に対しても誤って含意を予測した。
  • 結果から、現在の DNN ベースのモデルは真の推論的体系的一般化を学習できず、記憶や表面パターンに依存していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。