Skip to main content
QUICK REVIEW

[论文解读] A Simple LSTM model for Transition-based Dependency Parsing

Mohab Elkaref, Bernd Bohnet|arXiv (Cornell University)|Aug 29, 2017
Topic Modeling参考文献 20被引用 8
一句话总结

本文提出了一种基于LSTM的简单过渡式依存句法解析器,用单个LSTM层替代了传统的前馈隐藏层,并使用预训练的前馈网络权重初始化LSTM,以提升性能。该方法在Penn Treebank数据集上取得了93.06%的无标签附件得分(UAS)和91.01%的有标签附件得分(LAS),优于基线模型,且验证了输入dropout和门级初始化在LSTM、GRU和Elman网络中的有效性。

ABSTRACT

We present a simple LSTM-based transition-based dependency parser. Our model is composed of a single LSTM hidden layer replacing the hidden layer in the usual feed-forward network architecture. We also propose a new initialization method that uses the pre-trained weights from a feed-forward neural network to initialize our LSTM-based model. We also show that using dropout on the input layer has a positive effect on performance. Our final parser achieves a 93.06% unlabeled and 91.01% labeled attachment score on the Penn Treebank. We additionally replace LSTMs with GRUs and Elman units in our model and explore the effectiveness of our initialization method on individual gates constituting all three types of RNN units.

研究动机与目标

  • 通过用单层LSTM替换标准前馈隐藏层,提升过渡式依存句法解析的性能。
  • 探究使用预训练前馈网络权重初始化LSTM是否能提升句法解析的准确性。
  • 评估输入dropout对模型泛化能力和性能的影响。
  • 评估所提出的初始化方法在LSTM和GRU各门结构中的有效性。
  • 在相同的初始化和训练协议下,比较LSTM、GRU和Elman网络的性能表现。

提出的方法

  • 在标准过渡式句法解析中,用单层LSTM替代前馈隐藏层,以建模解析转换过程中的序列依赖关系。
  • 使用在相同任务上训练的前馈神经网络(FFN)的预训练参数初始化LSTM权重,以实现更快的收敛和更高的准确性。
  • 对输入层特征应用dropout,以正则化模型并减少过拟合。
  • 使用弧标准转换系统(包含栈、缓冲区和弧结构)作为解析器配置,通过反向传播端到端训练LSTM模型。
  • 通过将LSTM替换为GRU和Elman网络,评估初始化方法的通用性。
  • 通过分别初始化LSTM和GRU的各个门(输入门、遗忘门、输出门、候选门)进行消融实验,以评估其对性能的贡献。

实验结果

研究问题

  • RQ1用单个LSTM层替代前馈隐藏层是否能提升过渡式依存句法解析的性能?
  • RQ2使用预训练前馈网络权重初始化LSTM是否能显著提升句法解析的准确性?
  • RQ3输入dropout在提升LSTM解析器泛化能力和性能方面有多有效?
  • RQ4所提出的初始化方法是否在不同RNN单元(如GRU和Elman网络)中均能带来一致的性能提升?
  • RQ5在LSTM中,哪些单个门(输入门、遗忘门、输出门、候选门)最受益于所提出的初始化技术?

主要发现

  • 所提出的LSTM解析器在Penn Treebank测试集上取得了93.06%的无标签附件得分(UAS)和91.01%的有标签附件得分(LAS),优于基线前馈网络(FFN)和随机初始化的LSTM模型。
  • 使用预训练FFN权重初始化显著提升了LSTM性能,最终模型在多数方面优于或匹配当前最先进的基于LSTM的解析器。
  • 输入dropout始终能提升模型性能,表明其作为该架构正则化技术的有效性。
  • 对LSTM各门分别进行自举初始化的结果不一,其中输出门和候选门表现出最一致的性能提升,尤其是在使用预训练词嵌入时。
  • 该初始化方法在LSTM和Elman网络中均有效,但在GRU中效果较弱,使用预训练嵌入进行全门自举初始化反而导致性能显著下降。
  • 即使使用自举权重,GRU模型也未能超越基线前馈网络的性能,表明其在该句法解析任务中存在能力局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。