[论文解读] Unsupervised Recurrent Neural Network Grammars
该论文提出无监督循环神经网络语法(URNNGs),在无需标注句法树的情况下,联合学习语言建模与句法结构归纳。通过使用神经CRF作为推理网络的近似变分推断,URNNGs在英语和中文基准测试中均实现了具有竞争力的语言建模性能与强大的语法归纳能力,表现匹配或超过有监督RNNGs及近期神经模型。
Recurrent neural network grammars (RNNG) are generative models of language which jointly model syntax and surface structure by incrementally generating a syntax tree and sentence in a top-down, left-to-right order. Supervised RNNGs achieve strong language modeling and parsing performance, but require an annotated corpus of parse trees. In this work, we experiment with unsupervised learning of RNNGs. Since directly marginalizing over the space of latent trees is intractable, we instead apply amortized variational inference. To maximize the evidence lower bound, we develop an inference network parameterized as a neural CRF constituency parser. On language modeling, unsupervised RNNGs perform as well their supervised counterparts on benchmarks in English and Chinese. On constituency grammar induction, they are competitive with recent neural language models that induce tree structures from words through attention mechanisms.
研究动机与目标
- 开发一种无监督循环神经网络语法(RNNGs)学习方法,无需依赖标注的句法树,即可联合建模句法结构与句子表面结构。
- 通过采用具有结构化推理网络的近似变分推断,解决无监督RNNGs中对潜在句法树进行边缘化计算的不可行性问题。
- 通过使用神经CRF成分解析器作为推理网络,为生成模型注入有意义的归纳偏置,以引导树结构的发现。
- 在语言建模与成分语法归纳任务上评估URNNGs,与有监督RNNGs及当前最先进神经模型进行性能比较。
- 探究通过潜在变量显式学习句法结构是否能在无监督设置下提升语言建模性能并生成可解释的语法结构。
提出的方法
- 生成模型定义了句子 $ \mathbf{x} $ 与潜在句法树 $ \mathbf{z} $ 的联合概率 $ p_{\theta}(\mathbf{x}, \mathbf{z}) $,利用RNN通过移位与规约操作逐步构建句法树。
- 应用近似变分推断以可 tractable 的方式优化对数边缘似然 $ \log p_{\theta}(\mathbf{x}) $ 的下界,避免对所有可能句法树进行不可行的边缘化计算。
- 结构化推理网络(参数化为神经CRF成分解析器)近似真实后验 $ q_{\phi}(\mathbf{z} \mid \mathbf{x}) $,为发现非平凡树结构提供强归纳偏置。
- 推理网络使用双向LSTM表示与CRF势函数来建模成分跨度,全局归一化确保有效树分布。
- 通过最大化证据下界(ELBO)端到端训练模型,生成器与推理网络通过随机梯度下降联合优化。
- 在Penn Treebank与中文语料库上,通过语言建模(PPL)与语法归纳(F1、句法评估)对方法进行评估。
实验结果
研究问题
- RQ1无监督RNNGs是否能在无标注句法树的情况下,实现与有监督RNNGs相当的语言建模性能?
- RQ2在缺乏监督的情况下,使用神经CRF作为推理网络是否能有效引导发现有意义的句法结构?
- RQ3无监督RNNGs的性能与通过注意力机制诱导树结构的近期神经模型相比如何?
- RQ4在无监督设置下,句法与表面形式的联合建模在多大程度上提升了语言建模与语法归纳性能?
- RQ5受限解析器与通用语法学习器之间的交互,是否能产生类似于人类语言习得中观察到的语法偏置?
主要发现
- URNNGs在Penn Treebank上的测试困惑度达到90.6,优于有监督RNNG(88.7),并匹配强有监督模型的性能。
- 在成分语法归纳任务中,URNNGs在Penn Treebank上取得64.6%的F1分数,优于先前的无监督模型,并与近期使用注意力机制树归纳的神经模型相当。
- 在句法评估中,URNNGs在主谓一致任务上达到67.2%,在宾语从句任务上达到65.7%,在否定极性词项任务上达到55.0%,展现出强大的句法泛化能力。
- 模型对标点符号具有鲁棒性:即使在评估时移除标点,URNNGs仍保持强劲性能,表明其句法泛化能力超越表面线索。
- URNNGs表明,将变分推断与结构化推理网络结合,可有效实现无监督语言结构与语言建模的学习。
- 结果表明,通过潜在树结构引入的显式句法归纳偏置,即使在无监督条件下,也能显著提升语言建模与语法归纳性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。