Skip to main content
QUICK REVIEW

[论文解读] A Neural Transition-based Model for Nested Mention Recognition

Bailin Wang, Wei Lu|arXiv (Cornell University)|Oct 3, 2018
Topic Modeling参考文献 36被引用 6
一句话总结

本文提出一种基于神经转移的嵌套提及识别模型,通过移位-规约操作构建嵌套实体提及的森林结构表示,利用Stack-LSTM进行状态表示,并采用字符级LSTM捕捉形态模式。该模型在ACE-04和ACE-05数据集上达到最先进F1分数,展现出在嵌套提及识别上的优越性能,并且推理速度较之前方法快3-5倍。

ABSTRACT

It is common that entity mentions can contain other mentions recursively. This paper introduces a scalable transition-based method to model the nested structure of mentions. We first map a sentence with nested mentions to a designated forest where each mention corresponds to a constituent of the forest. Our shift-reduce based system then learns to construct the forest structure in a bottom-up manner through an action sequence whose maximal length is guaranteed to be three times of the sentence length. Based on Stack-LSTM which is employed to efficiently and effectively represent the states of the system in a continuous space, our system is further incorporated with a character-based component to capture letter-level patterns. Our model achieves the state-of-the-art results on ACE datasets, showing its effectiveness in detecting nested mentions.

研究动机与目标

  • 为解决文本中嵌套实体提及识别的挑战,传统序列标注模型因存在层次依赖关系而失效。
  • 开发一种可扩展且高效的嵌套提及识别方法,避免基于图表解析的立方时间复杂度。
  • 通过基于森林的表示显式建模层次依赖关系,以提升对嵌套提及的识别性能。
  • 引入字符级特征以增强对罕见或未登录词实体的识别能力。

提出的方法

  • 该模型将包含嵌套提及的句子映射为森林结构,其中每个最外层提及构成其嵌套成分的树结构,无需全局根节点。
  • 采用移位-规约转移系统通过一系列动作逐步构建森林,最大动作长度受限于句子长度的三倍。
  • 使用Stack-LSTM对系统状态(输入、栈和动作历史)进行编码,转化为连续向量空间,捕捉嵌套提及之间的依赖关系。
  • 通过Stack-LSTM操作组合而成的递归神经网络用于建模提及的组合结构,实现层次化表示学习。
  • 采用字符级双向LSTM处理词级子结构(如大写、词缀等),以提升形态特征提取能力。
  • 使用Adam优化器和Dropout进行训练,通过开发集调优早停策略与L2正则化。

实验结果

研究问题

  • RQ1基于转移的神经模型能否在保持线性时间复杂度的前提下有效识别嵌套实体提及?
  • RQ2与单个根节点树相比,森林结构在嵌套提及识别中的结构表达能力与计算效率如何?
  • RQ3字符级特征与Stack-LSTM状态表示在多大程度上提升了对嵌套提及的识别性能?
  • RQ4该模型是否在F1分数与解码速度两方面均优于现有方法,特别是在嵌套提及密度较高的数据集上?

主要发现

  • 所提模型在ACE-04和ACE-05数据集上达到最先进F1分数,分别为82.4%和81.3%,优于先前方法。
  • 在GENIA数据集上,模型在嵌套提及上取得71.6%的F1,在非嵌套提及上取得75.3%的F1,显示出对嵌套结构的显著改进。
  • 解码速度比Lu和Roth(2015)以及Muis和Lu(2017)快3-5倍,展现出优越的可扩展性。
  • 消融实验表明,预训练词向量、字符级LSTM与Dropout在所有数据集上均对性能有显著贡献。
  • 性能提升在嵌套提及上最为显著,证实了模型在处理层次结构方面的有效性。
  • 该模型的架构通过Stack-LSTM中的递归组合实现对嵌套依赖关系的高效建模,从而提升了识别准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。