Skip to main content
QUICK REVIEW

[论文解读] Combining Long Short Term Memory and Convolutional Neural Network for Cross-Sentence n-ary Relation Extraction

Angrosh Mandya, Danushka Bollegala|arXiv (Cornell University)|Nov 2, 2018
Topic Modeling被引用 10
一句话总结

该论文提出了一种LSTM-CNN混合模型,通过结合词嵌入和位置嵌入来提升跨句n元关系抽取性能,利用长距离序列建模和显著特征提取,在基准数据集上显著优于基线方法和当前最先进方法。

ABSTRACT

We propose in this paper a combined model of Long Short Term Memory and Convolutional Neural Networks (LSTM-CNN) that exploits word embeddings and positional embeddings for cross-sentence n-ary relation extraction. The proposed model brings together the properties of both LSTMs and CNNs, to simultaneously exploit long-range sequential information and capture most informative features, essential for cross-sentence n-ary relation extraction. The LSTM-CNN model is evaluated on standard dataset on cross-sentence n-ary relation extraction, where it significantly outperforms baselines such as CNNs, LSTMs and also a combined CNN-LSTM model. The paper also shows that the LSTM-CNN model outperforms the current state-of-the-art methods on cross-sentence n-ary relation extraction.

研究动机与目标

  • 解决跨多句的n元关系抽取挑战,传统基于模式或依存句法的方法难以处理此问题。
  • 克服在跨句关系抽取中处理长距离依赖关系和可变长度文本跨度的局限性。
  • 开发一种神经网络模型,有效结合LSTM在序列建模方面的优势与CNN在特征提取方面的优势。
  • 通过引入词频(wf)和位置特征(pf)等简单但有效的特征,提升n元关系抽取性能。
  • 证明仅使用端到端深度学习架构的简化模型,可超越依赖语言学特征或多任务学习的复杂模型。

提出的方法

  • 使用双向LSTM作为第一层,对t个连续句子的拼接词元序列进行编码,以捕捉长距离依赖关系。
  • 在LSTM的隐藏状态上应用一维卷积神经网络(CNN),以提取与关系分类相关的局部显著特征。
  • 将词嵌入和位置嵌入作为输入特征,以增强对词元位置和语义内容的表示。
  • 利用融合的LSTM-CNN架构,对可变长度文本跨度的固定长度表示进行n元关系分类。
  • 使用交叉熵损失进行端到端训练,通过注意力机制或池化操作在分类前减少序列长度。
  • 评估模型在有无额外特征(wf和pf)下的表现,表明简单特征已足以实现高性能。

实验结果

研究问题

  • RQ1结合LSTM-CNN的模型能否有效抽取跨越多个句子、涉及超过两个实体的n元关系?
  • RQ2所提出的LSTM-CNN模型在跨句n元关系抽取中,与独立的CNN、LSTM及CNN-LSTM模型相比表现如何?
  • RQ3与复杂语言学特征相比,词频(wf)和位置特征(pf)等简单特征在多大程度上提升性能?
  • RQ4所提出的模型是否在标准基准数据集上超越了当前最先进方法?
  • RQ5该模型是否能在不依赖外部知识或复杂解析的情况下,良好泛化于不同长度的文本跨度(单句与多句)?

主要发现

  • 所提出的LSTM-CNN+wf+pf模型在q&p数据集上对跨句三元关系抽取的F1得分为82.9,显著优于先前SOTA方法(80.7)。
  • 在CID数据集上,该模型对跨句二元关系抽取的F1得分为63.0,优于所有基线模型,包括CNN、LSTM和CNN+LSTM模型。
  • 该模型在q&p数据集上对跨句n元关系抽取的F1得分为82.9%,超越了先前SOTA的80.7%。
  • 使用wf和pf特征的LSTM-CNN模型在F1上优于使用复杂语言学特征、最大熵或SVM方法的模型。
  • LSTM与CNN的结合在精确率与召回率之间取得更优权衡,当使用CNN搭配wf或wf+pf时,F1分别为69.7和78.9。
  • 该模型在不同长度的文本跨度上表现出强鲁棒性,在单句和多句跨度上均表现优异,且无需依赖外部知识库或开发集调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。