Skip to main content
QUICK REVIEW

[论文解读] Joint RNN-Based Greedy Parsing and Word Composition

Joël Legrand, Ronan Collobert|arXiv (Cornell University)|Dec 22, 2014
Natural Language Processing Techniques被引用 6
一句话总结

该论文提出了一种基于RNN的联合贪心依赖解析器,采用循环神经网络以自底向上的方式组合子树的句法和语义表示,实现快速、端到端的训练,无需依赖人工设计的特征(如词干)。该方法在WSJ测试集上取得了具有竞争力的F1分数(使用集成模型最高达90.7),同时保持了较高的运行速度,证明了基于RNN的组合机制能够有效捕捉解析任务中的结构与语义信息。

ABSTRACT

This paper introduces a greedy parser based on neural networks, which leverages a new compositional sub-tree representation. The greedy parser and the compositional procedure are jointly trained, and tightly depends on each-other. The composition procedure outputs a vector representation which summarizes syntactically (parsing tags) and semantically (words) sub-trees. Composition and tagging is achieved over continuous (word or tag) representations, and recurrent neural networks. We reach F1 performance on par with well-known existing parsers, while having the advantage of speed, thanks to the greedy nature of the parser. We provide a fully functional implementation of the method described in this paper.

研究动机与目标

  • 开发一种快速、贪心的解析架构,避免依赖复杂的、人工设计的特征(如词干)
  • 将句法标注与子树组合整合到一个联合训练的RNN框架中
  • 探究递归组合词与词性标注表示是否能有效捕捉句法与语义信息
  • 在标准基准(如WSJ语料库)上评估解析器性能,并与现有最先进系统进行比较
  • 研究对词与词性标注嵌入表应用Dropout正则化对缓解神经网络解析模型过拟合的影响

提出的方法

  • 采用贪心的、从左到右的解析策略,通过每一步的局部决策逐步构建解析树
  • 使用循环神经网络(RNN)维护一个隐藏状态,用于总结已解析成分及其标注的历史信息
  • 通过RNN隐藏状态递归组合词与词性(POS)标注的连续向量表示,生成子树表示
  • 使用时间反向传播联合训练组合函数与标注/预测头
  • 在训练过程中对词与POS嵌入查找表应用Dropout正则化,并在推理时进行缩放,以防止过拟合
  • 通过多个独立初始化模型的模型平均(投票)提升泛化能力与F1性能

实验结果

研究问题

  • RQ1基于RNN的联合贪心解析架构是否能在不使用传统特征(如词干)的情况下实现具有竞争力的性能?
  • RQ2递归组合机制在在多大程度上能有效总结子树中的句法与语义信息?
  • RQ3将解析决策与组合过程整合到单一RNN框架中,对解析准确率与训练稳定性有何影响?
  • RQ4对嵌入表应用Dropout正则化是否能在不增加模型复杂度的前提下提升神经依赖解析模型的泛化能力?
  • RQ5对多个基于RNN的解析器进行集成平均是否能进一步提升标准基准上的F1性能?

主要发现

  • 在使用四个模型的集成并应用Dropout的情况下,该解析器在WSJ测试集(≤40词)上达到了90.7的F1分数,与最先进系统表现相当或更优
  • 通过Dropout正则化,模型在完整WSJ测试集上的F1分数从89.0提升至90.4,表明有效缓解了过拟合问题
  • 在10个独立训练模型的投票机制下,模型在完整WSJ测试集上达到90.1的F1分数,表明通过集成学习实现了强大的泛化能力
  • 由于采用贪心解析策略,系统保持了极高的运行速度,仅用30秒即可完成对完整WSJ测试集的解析,显著快于许多竞争性解析器
  • 错误分析显示,该模型在大多数错误类别上的表现与Socher等人(2013)和McClosky等人(2006)相当,仅在名词短语依存与并列结构上略高,但整体表现具有竞争力
  • 组合向量表示在定性上有效,通过最近邻分析显示,语义和句法上相似的短语在嵌入空间中也彼此接近

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。