Skip to main content
QUICK REVIEW

[論文レビュー] Structural Supervision Improves Learning of Non-Local Grammatical Dependencies

Ethan Wilcox, Peng Qian|arXiv (Cornell University)|Mar 3, 2019
Natural Language Processing Techniques参考文献 30被引用数 4
ひとこと要約

本稿は、構造的監視—明示的な階層的文法構造のモデル化—が、否定極性項(NPI)の許可やフィラー・ギャップ依存関係といった非局所的文法的依存関係の学習を神経言語モデルがどのように向上させるかを調査する。制御された心理言語学的刺激を用いて、再帰的ニューラルネットワーク文法(RNNG)とインクリメンタル化されたParsing-as-Language-Modeling設定が、標準的なLSTMを上回ることを示した。特に、島制約の処理において、RNNGは優れた性能と人間に類似した一般化を示した。

ABSTRACT

State-of-the-art LSTM language models trained on large corpora learn sequential contingencies in impressive detail and have been shown to acquire a number of non-local grammatical dependencies with some success. Here we investigate whether supervision with hierarchical structure enhances learning of a range of grammatical dependencies, a question that has previously been addressed only for subject-verb agreement. Using controlled experimental methods from psycholinguistics, we compare the performance of word-based LSTM models versus two models that represent hierarchical structure and deploy it in left-to-right processing: Recurrent Neural Network Grammars (RNNGs) (Dyer et al., 2016) and a incrementalized version of the Parsing-as-Language-Modeling configuration from Chariak et al., (2016). Models are tested on a diverse range of configurations for two classes of non-local grammatical dependencies in English---Negative Polarity licensing and Filler--Gap Dependencies. Using the same training data across models, we find that structurally-supervised models outperform the LSTM, with the RNNG demonstrating best results on both types of grammatical dependencies and even learning many of the Island Constraints on the filler--gap dependency. Structural supervision thus provides data efficiency advantages over purely string-based training of neural language models in acquiring human-like generalizations about non-local grammatical dependencies.

研究の動機と目的

  • 構造的監視が神経言語モデルにおける非局所的文法的依存関係の学習を改善するかどうかを評価すること。
  • 標準的なLSTM、RNNG、およびインクリメンタル化されたParsing-as-Language-Modelingモデルの、複雑な文法的依存関係における性能を比較すること。
  • 構文的監視で学習したモデルが、島制約のような人間の一般化を、純粋に逐次的なモデルよりも効果的に学習できるかどうかをテストすること。
  • 構文的一般化のための低データ環境下での、構造的監視によるデータ効率の向上を評価すること。
  • RNNGのようなモデルにおける明示的な構成的性が、線形的に離れているが構文的に局所的な成分間で文法的期待をよりよく伝えることができるかどうかを調査すること。

提案手法

  • 本研究では、標準的な2層LSTM(256個の隠れユニット)、スタック、アクション、端末処理用に別々のLSTMを備えたRNNG、およびCharniakら(2016)の研究から派生したインクリメンタル化されたParsing-as-Language-Modelingモデルの3つのモデルを比較した。
  • すべてのモデルは同一の100万語のコーパスで学習させ、モデルアーキテクチャの違いによる公平な比較を確保した。
  • RNNGはニューラルスタックとアクションベースの構文解析(nt、シフト、リダクション)を用い、左から右への処理中に段階的に階層的文法構造を構築する。
  • インクリメンタル化されたParsing-as-Language-Modelingモデルはニューラルスタックと出力バッファを削除し、構文的監視の目的でアクション予測と語の生成のみを保持した。
  • モデルの性能は、NPI許可やフィラー・ギャップ依存関係を含む特定の文法的依存関係を調べる心理言語学的に制御された刺激を用いて評価した。
  • テストには、文法的・非文法的継続の確率順位付けによる受容可能性判断が含まれ、許可相互作用の統計的有意性が評価された。

実験結果

リサーチクエスチョン

  • RQ1構造的監視は、否定極性項の許可といった非局所的文法的依存関係の学習を向上させるか?
  • RQ2RNNGやインクリメンタル化されたParsing-as-Language-Modelingのような構造的監視モデルは、標準的なLSTMよりもフィラー・ギャップ依存関係をよりよく捉えられるか?
  • RQ3構造的監視モデルは、その予測において島制約のような人間に類似した一般化を示すか?
  • RQ4構造的監視は、複雑な文法的依存関係の学習におけるデータ効率をどの程度向上させるか?
  • RQ5明示的な構成的性を持つモデル(RNNGなど)は、線形的に離れているが構文的に局所的な成分間で文法的期待をよりよく維持できるか?

主な発見

  • RNNGは、強い許可相互作用が期待される13のフィラー・ギャップ依存関係テストのうち8つでLSTMを顕著に上回った。
  • ActionLSTMは13のテストのうち5つでLSTMを上回り、構文的監視による明確な利点が示された。
  • RNNGは、木構造的に局所的な文脈で、最も強いwh-許可効果を示し、ギャップ期待の維持が優れていた。
  • RNNGとActionLSTMの両方が、主語修飾の前置詞句(島条件)における許可相互作用を顕著に減少させた。RNNGではp < 0.001、ActionLSTMではp < 0.01であった。
  • LSTMは、主語修飾と目的語修飾の前置詞句を区別できず、誤って主語島からのwh抽出を許容した。
  • 構造的監視により、NPI許可の学習が、大規模データのLSTMですら上回る結果となり、データ効率の優位性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。