Skip to main content
QUICK REVIEW

[论文解读] Compound Probabilistic Context-Free Grammars for Grammar Induction

Yoon Kim, Chris Dyer|arXiv (Cornell University)|Jun 24, 2019
Topic Modeling参考文献 90被引用 7
一句话总结

该论文提出了一种复合概率上下文无关文法(PCFG),通过神经网络参数化规则概率,并引入句子级别的连续潜在变量以建模超出标准PCFG假设的长距离依赖关系。通过结合变分推断的近似方法与动态规划以边缘化潜在句法树,该方法在英语和中文基准测试上实现了最新的无监督句法分析性能。

ABSTRACT

We study a formalization of the grammar induction problem that models sentences as being generated by a compound probabilistic context-free grammar. In contrast to traditional formulations which learn a single stochastic grammar, our grammar's rule probabilities are modulated by a per-sentence continuous latent variable, which induces marginal dependencies beyond the traditional context-free assumptions. Inference in this grammar is performed by collapsed variational inference, in which an amortized variational posterior is placed on the continuous variable, and the latent trees are marginalized out with dynamic programming. Experiments on English and Chinese show the effectiveness of our approach compared to recent state-of-the-art methods when evaluated on unsupervised parsing.

研究动机与目标

  • 解决传统PCFG在语法归纳中的局限性,特别是其严格的独立性假设和优化困难的损失函数景观。
  • 克服使用标准PCFG与最大似然估计从原始文本中归纳出语言学上有意义语法的困难。
  • 引入每个句子的连续潜在向量以建模上下文相关的规则概率,从而在生成过程中支持长距离依赖。
  • 开发一种高效的推断方法,结合坍缩变分推断与动态规划,以边缘化潜在句法树。
  • 在英语和中文数据集上,展示该方法在无监督句法分析性能上优于近期的神经网络与概率方法。

提出的方法

  • 使用将非终结符和终结符的分布式表示映射为规则概率的神经网络,对PCFG规则概率进行参数化。
  • 引入句子级别的连续潜在向量以调制规则概率,构建一种复合PCFG,从而放松严格的上下文无关独立性假设。
  • 采用近端变分推断并结合识别网络近似潜在向量的后验分布,实现端到端训练。
  • 应用坍缩变分推断:对于固定的潜在向量,使用动态规划(如CKY类算法)对所有可能的句法树进行边缘化。
  • 通过重参数化随机梯度下降优化观测句子的对数边缘似然,利用可微分推断。
  • 通过反向传播通过动态规划计算过程进行训练,实现语法参数与潜在表示的联合优化。

实验结果

研究问题

  • RQ1PCFG规则概率的神经网络参数化是否能提升PCFG最大似然学习的有效性与稳定性?
  • RQ2句子级别的连续潜在变量是否能超越标准PCFG假设,在无监督语法归纳中更好地建模长距离依赖?
  • RQ3结合坍缩变分推断的复合PCFG框架是否在无监督句法分析中优于近期的最先进方法?
  • RQ4模型性能对网络架构选择(如残差连接、归一化层及推断网络设计)的敏感性如何?
  • RQ5该方法是否具备跨语言泛化能力,如在英语和中文数据集上所展示的?

主要发现

  • PCFG规则概率的神经网络参数化使得通过简单的最大似然优化实现有效的语法归纳成为可能,从而克服了以往的优化困难。
  • 引入句子级别潜在向量的复合PCFG能够捕捉超出一阶上下文无关假设的依赖关系,实现更丰富的句法泛化能力。
  • 该模型在英语和中文的无监督句法分析基准测试中均达到最先进性能,优于近期的神经网络与概率方法。
  • 该方法对模型架构敏感——神经网络中的残差连接对性能至关重要,尽管在不同随机种子下结果存在一定程度的波动。
  • 尽管由于$O(|\mathcal{R}||\boldsymbol{x}|^3)$的动态规划步骤导致计算成本较高,该方法在标准数据集上仍保持可行且高效。
  • 该框架具有通用性,可适用于其他具有条件可处理推断的生成模型,表明其在语法归纳之外也具备广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。