Skip to main content
QUICK REVIEW

[论文解读] Differentiable Perturb-and-Parse: Semi-Supervised Parsing with a Structured Variational Autoencoder

Caio Corro, Ivan Titov|arXiv (Cornell University)|Jul 25, 2018
Natural Language Processing Techniques被引用 44
一句话总结

本论文提出一种基于结构化变分自编码器的半监督依存句法分析器,以及一个可微分的扰动与解析机制,用以对潜在树进行采样并学习,实验在英文、法文和瑞典语上进行。

ABSTRACT

Human annotation for syntactic parsing is expensive, and large resources are available only for a fraction of languages. A question we ask is whether one can leverage abundant unlabeled texts to improve syntactic parsers, beyond just using the texts to obtain more generalisable lexical features (i.e. beyond word embeddings). To this end, we propose a novel latent-variable generative model for semi-supervised syntactic dependency parsing. As exact inference is intractable, we introduce a differentiable relaxation to obtain approximate samples and compute gradients with respect to the parser parameters. Our method (Differentiable Perturb-and-Parse) relies on differentiable dynamic programming over stochastically perturbed edge scores. We demonstrate effectiveness of our approach with experiments on English, French and Swedish.

研究动机与目标

  • 通过利用超出通用词嵌入的未标注文本来降低句法标注的高成本。
  • 提出一个概率生成模型,其中句子由一个潜在依存树和一个句子嵌入生成。
  • 用变分自编码器目标结合有监督数据上的判别目标来训练模型。
  • 引入可微分的扰动与解析方法,以对潜在依存树进行采样并进行梯度传播。

提出的方法

  • 定义一个生成模型,其潜在变量是一个投影依存树T和一个句子嵌入z,p(s|T,z)由神经网络参数化。
  • 使用变分分布 qφ(T,z|s) 来近似后验,并最大化一个结合无监督和有监督项的ELBO。
  • 将编码器分解为 qφ(T|s) qφ(z|s),T由对数线性弧权模型参数化,z通过来自LSTM的对角高斯分布参数化。
  • 在以z为条件的LSTM上进行自回归解码,使用图卷积网络将T中的句法结构并入解码。
  • 采用可微分的扰动与解析:用类似Gumbel的噪声扰动弧权,并使用可微分的解析代理,以实现对T的梯度学习。

实验结果

研究问题

  • RQ1未标注数据是否可以在超越学习的词表示的基础上提升神经依存句法分析?
  • RQ2可微分的扰动与解析是否为VAE框架中的潜在依存树提供可行的梯度路径?
  • RQ3与有监督基线相比,半监督VAE在英语、法语和瑞典语上的表现如何?
  • RQ4应如何将生成性目标与判别性目标结合起来以有效训练解析器?

主要发现

  • 该方法引入了用于半监督依存句法分析的变分自编码器框架。
  • 一个可微分的扰动与解析算子使通过潜在树进行基于梯度的学习成为可能。
  • 与可比的有监督基线相比,该方法在英语、法语和瑞典语上显示出有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。