Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Learning of Syntactic Structure with Invertible Neural Projections

Junxian He, Graham Neubig|arXiv (Cornell University)|Aug 28, 2018
Topic Modeling参考文献 36被引用 4
一句话总结

该论文提出了一种新颖的无监督生成模型,通过可逆神经投影联合学习离散句法结构(如词性标注、依存树)和连续词嵌入。通过利用可逆性实现精确推断和边缘似然计算,该模型在宾夕法尼亚语料库上实现了词性标注归纳和无监督依存句法分析的最先进性能,且无需使用黄金词性标注或标点符号约束。

ABSTRACT

Unsupervised learning of syntactic structure is typically performed using generative models with discrete latent variables and multinomial parameters. In most cases, these models have not leveraged continuous word representations. In this work, we propose a novel generative model that jointly learns discrete syntactic structure and continuous word representations in an unsupervised fashion by cascading an invertible neural network with a structured generative prior. We show that the invertibility condition allows for efficient exact inference and marginal likelihood computation in our model so long as the prior is well-behaved. In experiments we instantiate our approach with both Markov and tree-structured priors, evaluating on two tasks: part-of-speech (POS) induction, and unsupervised dependency parsing without gold POS annotation. On the Penn Treebank, our Markov-structured model surpasses state-of-the-art results on POS induction. Similarly, we find that our tree-structured model achieves state-of-the-art performance on unsupervised dependency parsing for the difficult training condition where neither gold POS annotation nor punctuation-based constraints are available.

研究动机与目标

  • 通过联合学习离散句法结构和连续嵌入,弥合无监督句法建模与连续词表示之间的差距。
  • 通过在神经投影中强制可逆性,实现在具有离散潜变量的生成模型中精确推断和边缘似然计算。
  • 通过从原始文本中学习更具结构化、句法感知的嵌入空间,提升无监督词性标注归纳和依存句法分析的性能。
  • 证明可逆投影可引导学习到的嵌入聚焦于句法特性,而无需任何监督或词形标注。

提出的方法

  • 该模型使用结构化先验(马尔可夫或树状结构)为每个词生成离散句法标签。
  • 从以离散句法标签为条件的高斯分布中采样潜在连续嵌入。
  • 通过可逆神经网络将潜在嵌入映射到观测空间,生成观测到的预训练词嵌入。
  • 神经投影的可逆性使得在先验可处理的前提下,能够实现精确后验推断和边缘似然计算。
  • 通过最大化边缘似然,端到端训练模型,其中投影器的逆用于参数化似然函数。
  • 引入雅可比正则化项,以防止可逆变换过程中的信息损失。

实验结果

研究问题

  • RQ1可逆神经网络是否能在具有离散潜变量的生成模型中实现精确推断和边缘似然计算?
  • RQ2联合学习连续词嵌入和句法结构是否能提升无监督句法分析任务的性能?
  • RQ3所学习的嵌入空间是否能比 skip-gram 等预训练嵌入更好地捕捉句法相似性?
  • RQ4在低资源设置下(如无黄金词性标注或标点符号约束)模型表现如何?

主要发现

  • 马尔可夫结构模型在宾夕法尼亚语料库的词性标注归纳任务中达到最先进性能,超越以往无监督模型。
  • 树状结构模型(使用 DMV)在最严苛的训练条件下——无黄金词性标注或标点符号约束——实现了无监督依存句法分析的最先进结果。
  • t-SNE 可视化显示,所学习的潜在嵌入形成与黄金词性标注相对应的清晰分离聚类,尤其在马尔可夫结构下表现更佳。
  • DMV 结构模型所学习的嵌入能区分主语和宾语名词,即使在无依存监督的情况下。
  • 与高斯基线相比,该模型性能更优,且在使用 fastText 嵌入时仍保持强性能,表明对嵌入来源具有鲁棒性。
  • 定性分析确认,所学习的嵌入聚焦于句法相似性,最近邻样本反映的是句法而非语义相似性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。