[論文レビュー] Unsupervised Recurrent Neural Network Grammars
本稿では、アノテートされた解析木を必要とせずに、言語モデル学習と句構造誘導を統合的に学習する非教師付き再帰的ニューラルネットワーク文法(URNNG)を提案する。アーモナイズド変分推論とニューラルCRFを推論ネットワークとして用いることで、URNNGは競争力ある言語モデル性能と強力な文法誘導性能を達成し、英語および中国語のベンチマークにおいて、教師ありRNNGや最近のニューラルモデルと同等またはそれを上回る性能を示した。
Recurrent neural network grammars (RNNG) are generative models of language which jointly model syntax and surface structure by incrementally generating a syntax tree and sentence in a top-down, left-to-right order. Supervised RNNGs achieve strong language modeling and parsing performance, but require an annotated corpus of parse trees. In this work, we experiment with unsupervised learning of RNNGs. Since directly marginalizing over the space of latent trees is intractable, we instead apply amortized variational inference. To maximize the evidence lower bound, we develop an inference network parameterized as a neural CRF constituency parser. On language modeling, unsupervised RNNGs perform as well their supervised counterparts on benchmarks in English and Chinese. On constituency grammar induction, they are competitive with recent neural language models that induce tree structures from words through attention mechanisms.
研究の動機と目的
- アノテートされた解析木を必要とせずに、構文と文の表面構造を統合的にモデル化する非教師付き再帰的ニューラルネットワーク文法(RNNG)の学習手法を開発すること。
- 非教師付きRNNGにおける潜在的解析木の周辺化の非 tractable 性を解消するため、構造的推論ネットワークを用いたアーモナイズド変分推論を採用すること。
- 推論ネットワークとしてニューラルCRF構文解析器を用いることで、生成モデルに意味のあるインダクティブバイアスを組み込み、非自明な木構造の発見を支援すること。
- URNNGの言語モデル学習および構文的文法誘導性能を、教師ありRNNGおよび最先端のニューラルモデルと比較して評価すること。
- 潜在変数による明示的な構文構造学習が、非教師付き設定において言語モデル学習と解釈可能な文法構造の誘導をどのように改善するかを検討すること。
提案手法
- 生成モデルは、RNNを用いてシフト・リダクション操作を段階的に実行することで構文木を構築する。このプロセスにより、文 $ \mathbf{x} $ と潜在的解析木 $ \mathbf{z} $ の同時確率 $ p_{\theta}(\mathbf{x}, \mathbf{z}) $ が定義される。
- 潜在的解析木のすべての可能性について周辺化を行う非 tractable 性を回避するため、対数周辺尤度 $ \log p_{\theta}(\mathbf{x}) $ の下界を効率的に最適化するアーモナイズド変分推論が適用される。
- 構造的推論ネットワークとして、ニューラルCRF構文解析器をパラメータ化し、真の事後分布 $ q_{\phi}(\mathbf{z} \mid \mathbf{x}) $ を近似することで、非自明な木構造の発見に強いインダクティブバイアスを提供する。
- 推論ネットワークは双方向LSTM表現とCRFポテンシャルを用い、構文的スパンをモデル化し、グローバル正規化により有効な木分布を保証する。
- 生成器と推論ネットワークを同時に最適化するため、確率的勾配降下法を用いてエビデンス下界(ELBO)を最大化することで、エンドツーエンドでモデルを訓練する。
- Penn Treebankおよび中国語のツリー・バンクを用いて、言語モデル(PPL)および構文的文法誘導(F1、構文的評価)の両面で評価が行われる。
実験結果
リサーチクエスチョン
- RQ1アノテートされた解析木にアクセスできない状況下でも、非教師付きRNNGは教師ありRNNGと同等の言語モデル性能を達成できるか?
- RQ2推論ネットワークとしてニューラルCRFを用いることで、教師なし状況下でも意味のある構文構造の発見が効果的に促進されるか?
- RQ3注意機構を用いた木構造誘導を行う最近のニューラルモデルと比較して、非教師付きRNNGの性能はどの程度か?
- RQ4構文と表面形の統合的モデリングが、非教師付き設定において言語モデル学習および文法誘導をどの程度改善するか?
- RQ5制限付き解析器と一般化された文法学習器との相互作用が、人間の言語習得で観察されるような文法的バイアスを生み出すことができるか?
主な発見
- URNNGはPenn Treebankでテストパーフレクシティ(PPL)90.6を達成し、教師ありRNNG(88.7)を上回り、強力な教師ありモデルと同等の性能を示した。
- 構文的文法誘導において、URNNGはPenn TreebankでF1スコア64.6%を達成し、先行する非教師付きモデルを上回り、注意ベースの木構造誘導を用いる最近のニューラルモデルと同等の性能を示した。
- 構文的評価では、主語・動詞一致で67.2%、目的格の相対節で65.7%、否定極性項目で55.0%を達成し、強力な構文一般化能力を示した。
- モデルは標点の有無にかかわらず頑健であることが判明した。評価時に標点が除去されても、URNNGは依然として優れた性能を維持しており、表面的ヒントを超えた構文一般化が有効に実現されていることを示している。
- 変分推論と構造的推論ネットワークの組み合わせにより、URNNGは言語的構造と言語モデル学習の両方を効果的に非教師付きで学習可能であることが明らかになった。
- 結果から、潜在的木構造からの明示的な構文的インダクティブバイアスが、教師なし状況下でも言語モデル学習および文法誘導を顕著に改善することが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。