Skip to main content
QUICK REVIEW

[论文解读] Structural Supervision Improves Learning of Non-Local Grammatical Dependencies

Ethan Wilcox, Peng Qian|arXiv (Cornell University)|Mar 3, 2019
Natural Language Processing Techniques参考文献 30被引用 4
一句话总结

本文研究了结构化监督——显式建模层次句法结构——是否能提升神经语言模型对非局部语法依赖关系(如否定极性词项NPI许可和填充空缺依赖)的学习能力。通过使用受控的心理语言学刺激,研究发现循环神经网络语法(RNNGs)和一种增量化的解析即语言建模配置在性能上优于标准LSTM模型,其中RNNG表现出更优的性能以及更强的人类类似泛化能力,尤其在处理岛屿约束方面表现突出。

ABSTRACT

State-of-the-art LSTM language models trained on large corpora learn sequential contingencies in impressive detail and have been shown to acquire a number of non-local grammatical dependencies with some success. Here we investigate whether supervision with hierarchical structure enhances learning of a range of grammatical dependencies, a question that has previously been addressed only for subject-verb agreement. Using controlled experimental methods from psycholinguistics, we compare the performance of word-based LSTM models versus two models that represent hierarchical structure and deploy it in left-to-right processing: Recurrent Neural Network Grammars (RNNGs) (Dyer et al., 2016) and a incrementalized version of the Parsing-as-Language-Modeling configuration from Chariak et al., (2016). Models are tested on a diverse range of configurations for two classes of non-local grammatical dependencies in English---Negative Polarity licensing and Filler--Gap Dependencies. Using the same training data across models, we find that structurally-supervised models outperform the LSTM, with the RNNG demonstrating best results on both types of grammatical dependencies and even learning many of the Island Constraints on the filler--gap dependency. Structural supervision thus provides data efficiency advantages over purely string-based training of neural language models in acquiring human-like generalizations about non-local grammatical dependencies.

研究动机与目标

  • 评估结构化监督是否能提升神经语言模型对非局部语法依赖关系的学习能力。
  • 比较标准LSTM、RNNG和一种增量化的解析即语言建模模型在复杂句法依赖关系上的表现。
  • 检验经过句法监督训练的模型是否比纯粹序列化模型更有效地学习人类类似的泛化,如岛屿约束。
  • 评估在低数据环境下,结构化监督对句法泛化能力的数据效率增益。
  • 探究像RNNG这样的模型中显式组合性是否能更有效地在空间上相距较远但句法上相邻的成分之间传播句法预期。

提出的方法

  • 本研究比较了三种模型:一个具有256个隐藏单元的2层标准LSTM,一个使用独立LSTM分别处理栈、动作和终端的RNNG,以及一种源自Charniak等人(2016)的增量化解析即语言建模模型。
  • 所有模型均在相同规模的100万词语料库上进行训练,以确保在不同模型架构间的公平比较。
  • RNNG通过神经栈和基于动作的解析(nt、shift、reduce)在自左向右处理过程中逐步构建层次句法结构。
  • 增量化的解析即语言建模模型去除了神经栈和输出缓冲区,仅保留动作预测和词生成功能,以实现句法监督。
  • 通过心理语言学控制的刺激材料评估模型性能,这些材料专门用于探测特定的语法依赖关系,包括NPI许可和填充空缺依赖。
  • 测试内容包括通过语法正确与错误延续的生成概率排序进行可接受性判断,其统计显著性通过许可交互作用的检验来评估。

实验结果

研究问题

  • RQ1结构化监督是否能提升对非局部语法依赖关系(如否定极性词项许可)的学习?
  • RQ2像RNNG和增量化解析即语言建模这样的结构化监督模型是否能比标准LSTM更好地捕捉填充空缺依赖?
  • RQ3结构化监督模型在预测中是否表现出更接近人类的泛化特征,如岛屿约束?
  • RQ4在学习复杂句法依赖关系方面,结构化监督在多大程度上提升了数据效率?
  • RQ5具有显式组合性的模型(如RNNG)是否能更有效地在空间上相距较远但句法上局部的成分之间维持句法预期?

主要发现

  • 在13项预期存在强烈许可交互作用的填充空缺依赖测试中,RNNG在其中8项上显著优于LSTM。
  • 在13项此类测试中,ActionLSTM在5项上优于LSTM,表明句法监督带来了可测量的性能增益。
  • RNNG在树结构局部的上下文中表现出最强的wh-许可效应,表明其对空缺预期的维持能力更强。
  • RNNG和ActionLSTM均在主语修饰的介词短语(岛屿条件)中显著减少了许可交互作用,RNNG的p值<0.001,ActionLSTM的p值<0.01。
  • LSTM无法区分主语修饰和宾语修饰的介词短语,错误地允许从主语岛屿中提取wh成分。
  • 结构化监督使模型在NPI许可学习方面优于甚至大型数据集下的LSTM,展现出显著的数据效率优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。