[論文レビュー] What Syntactic Structures block Dependencies in RNN Language Models?
この論文は、RNN言語モデルが句構造的島制約を学習するかどうかを調査し、複雑な句構造を通じて埋め込みギャップ依存関係と性別一致の期待を維持できるかをテストする。制御された実験を用いて、著者らは最先端のLSTMが左枝島と協調島制約を段階的に学習するが、文の主語島制約は学習できないことを示し、単なる文法的複雑さを越えて階層的な文法的構造に感受性を示していることを明らかにした。
Recurrent Neural Networks (RNNs) trained on a language modeling task have been shown to acquire a number of non-local grammatical dependencies with some success. Here, we provide new evidence that RNN language models are sensitive to hierarchical syntactic structure by investigating the filler--gap dependency and constraints on it, known as syntactic islands. Previous work is inconclusive about whether RNNs learn to attenuate their expectations for gaps in island constructions in particular or in any sufficiently complex syntactic environment. This paper gives new evidence for the former by providing control studies that have been lacking so far. We demonstrate that two state-of-the-art RNN models are are able to maintain the filler--gap dependency through unbounded sentential embeddings and are also sensitive to the hierarchical relationship between the filler and the gap. Next, we demonstrate that the models are able to maintain possessive pronoun gender expectations through island constructions---this control case rules out the possibility that island constructions block all information flow in these networks. We also evaluate three untested islands constraints: coordination islands, left branch islands, and sentential subject islands. Models are able to learn left branch islands and learn coordination islands gradiently, but fail to learn sentential subject islands. Through these controls and new tests, we provide evidence that model behavior is due to finer-grained expectations than gross syntactic complexity, but also that the models are conspicuously un-humanlike in some of their performance characteristics.
研究の動機と目的
- RNN言語モデルが文法的島制約を学習するのか、単に文法的複雑さに感受性を示すだけなのかを特定すること。
- モデルが島構造を通じて埋め込みギャップ依存関係と性別一致の期待を維持できるかをテストすること。
- 協調島、左枝島、文の主語島という以前にテストされていなかった島制約に対するモデルの感受性を評価すること。
- RNNの行動における一般的な文法的複雑さの影響と、細かく分類された文法的構造への感受性の違いを区別すること。
提案手法
- 埋め込みギャップ依存関係と性別一致の期待を含む制御された文のペアを設計し、島構造のみが異なるようにした。
- GoogleとGulordavaの2つの最先端のLSTM言語モデルを用い、島条件と非島条件における確率差を測定した。
- 文法的感受性の指標として、wh-許可の相互作用と性別期待の弱体化を測定した。
- 非有界な文の埋め込みを用いた実験を通じて、複雑なネスティング構造を経ても依存関係が維持されるかをテストした。
- 4種類の島タイプ(wh島、複雑な名詞句島、付加語島)と、3つの新規タイプ(協調島、左枝島、文の主語島)を対象にモデルを評価した。
- 有意性を評価するために統計的検定(例:p < 0.01, p < 0.05)を適用した。
実験結果
リサーチクエスチョン
- RQ1RNN言語モデルは文法的島におけるギャップの期待を弱体化させるのか、それとも一般的な文法的複雑さによる影響なのか?
- RQ2RNNは非有界な文の埋め込みを通じて埋め込みギャップ依存関係を維持できるか?
- RQ3RNNは、島制約によって示されるように、階層的な文法的構造に感受性を示すのか、それとも構造的でない複雑さと区別できないのか?
- RQ4RNNは左枝島、協調島、文の主語島を、それぞれの成功度合いに応じて学習するのか?
主な発見
- GoogleとGulordavaのモデルは、非有界な文の埋め込みを通じても埋め込みギャップ依存関係を維持しており、長距離依存関係学習の強固さを示している。
- 左枝島条件において、wh-許可の相互作用が顕著に減少した(Googleではp < 0.001、Gulordavaではp < 0.05)。これは左枝島制約の学習を示している。
- 協調島については段階的な学習が見られ、部分的な感受性は示したが、期待の完全な弱体化までは達していない。
- 両モデルにおいて、文の主語島ではwh-許可や性別期待に有意な減少が観察されず、この制約を学習できていないことが示された。
- 性別一致の期待は、すべての島タイプで保持されたため、一般化された情報伝達の遮断を排除し、細かく分類された文法的感受性を支持するものとなった。
- モデルは7つの島制約のうち5つ(Gulordavaでは6つ)を学習しており、一般的な複雑さではなく、階層的な文法的構造への選択的感受性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。