Skip to main content
QUICK REVIEW

[论文解读] Fine-Grained Prediction of Syntactic Typology: Discovering Latent Structure with Supervised Learning

Dingquan Wang, Jason Eisner|arXiv (Cornell University)|Oct 11, 2017
Natural Language Processing Techniques参考文献 30被引用 6
一句话总结

本文提出一种监督学习方法,仅使用词性(POS)序列来预测语言中57种依存关系的细粒度句法类型——具体为关系的方向性。通过在真实语言与合成语言的混合数据上进行训练,该方法在估计如dobj或amod等关系为右头结构的频率方面表现出高准确率,优于语法归纳基线方法,并且在POS标签存在噪声的情况下仍具有强大的泛化能力。

ABSTRACT

We show how to predict the basic word-order facts of a novel language given only a corpus of part-of-speech (POS) sequences. We predict how often direct objects follow their verbs, how often adjectives follow their nouns, and in general the directionalities of all dependency relations. Such typological properties could be helpful in grammar induction. While such a problem is usually regarded as unsupervised learning, our innovation is to treat it as supervised learning, using a large collection of realistic synthetic languages as training data. The supervised learner must identify surface features of a language's POS sequence (hand-engineered or neural features) that correlate with the language's deeper structure (latent trees). In the experiment, we show: 1) Given a small set of real languages, it helps to add many synthetic languages to the training data. 2) Our system is robust even when the POS sequences include noise. 3) Our system on this task outperforms a grammar induction baseline by a large margin.

研究动机与目标

  • 仅使用词性标注语料而非句法树,预测语言中依存关系(如dobj、amod)的方向性。
  • 探究在合成语言上进行监督学习是否能提升对未见真实语言的方向性预测能力。
  • 开发一种从表层POS序列中提取潜在句法结构的方法,以支持多语言NLP中的语言嵌入。
  • 为WALS等人工编制的类型学数据库(可能存在不完整或不一致的问题)提供一种稳健、数据驱动的替代方案。
  • 通过提供基本语序倾向的先验知识,支持语法归纳。

提出的方法

  • 该模型将句法类型预测视为监督学习任务,使用[0,1]区间内的方向性分数作为每种依存关系的标签。
  • 训练数据包括通过概率语法生成的1,000种合成语言,以及来自Universal Dependencies项目的100种真实语言。
  • 特征从POS序列中提取——可采用人工设计(如POS二元组、三元组)或通过神经网络学习。
  • 多输出回归器同时预测57种UD依存类型的每一种方向性,损失按关系频率加权。
  • 在保留的真实语言上进行评估,通过平均绝对误差(MAE)和方向性谱的排序准确率衡量性能。
  • 通过在POS序列中引入噪声来测试鲁棒性,以模拟现实中的标注错误。

实验结果

研究问题

  • RQ1与无监督或零样本方法相比,在合成语言上进行监督学习是否能提升对未见真实语言的方向性预测性能?
  • RQ2在仅使用真实语言数据训练的模型中,引入合成语言如何影响其泛化性能?
  • RQ3在输入存在噪声的情况下,仅从POS序列训练的模型在多大程度上仍能准确预测细粒度依存关系的方向性?
  • RQ4预测的方向性向量能否作为有效的语言嵌入或语法归纳的先验?
  • RQ5该模型在捕捉基本语序倾向方面是否优于现有的语法归纳基线方法?

主要发现

  • 在训练数据中加入合成语言显著提升了在保留真实语言上的性能,证明了在类型学预测中数据增强的有效性。
  • 在新语言中联合预测全部57种依存类型的总误差极低(MAE < 0.1),结果接近黄金标准标注。
  • 即使在高达20%的标签被破坏的情况下,系统仍对POS序列中的噪声保持鲁棒,维持高预测准确率。
  • 该模型在预测方向性方面大幅优于语法归纳基线,表明类型学先验可有效引导语法归纳。
  • 该模型成功在方向性谱上对语言进行排序,展现出在类型学差异下的稳定且有意义的泛化能力。
  • 在本设置中,神经特征并未优于人工设计特征,但未来结合词嵌入后可能更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。