Skip to main content
QUICK REVIEW

[论文解读] Chinese Event Extraction Using DeepNeural Network with Word Embedding

Yandi Xia, Yang Liu|arXiv (Cornell University)|Oct 4, 2016
Natural Language Processing Techniques被引用 3
一句话总结

本文提出一种基于词嵌入的深度神经网络(DNN)模型用于中文事件触发词识别,无需人工特征工程。通过利用大规模未标注文本预训练词嵌入,该模型在召回率方面表现优异,性能优于传统基于特征的系统,即使仅使用自动生成的命名实体也表现更优。

ABSTRACT

A lot of prior work on event extraction has exploited a variety of features to represent events. Such methods have several drawbacks: 1) the features are often specific for a particular domain and do not generalize well; 2) the features are derived from various linguistic analyses and are error-prone; and 3) some features may be expensive and require domain expert. In this paper, we develop a Chinese event extraction system that uses word embedding vectors to represent language, and deep neural networks to learn the abstract feature representation in order to greatly reduce the effort of feature engineering. In addition, in this framework, we leverage large amount of unlabeled data, which can address the problem of limited labeled corpus for this task. Our experiments show that our proposed method performs better compared to the system using rich language features, and using unlabeled data benefits the word embeddings. This study suggests the potential of DNN and word embedding for the event extraction task.

研究动机与目标

  • 探究深度神经网络与词嵌入是否能减少中文事件触发词识别中对手工设计语言学特征的依赖。
  • 评估词嵌入在该任务中是否提供比传统领域特定特征更有效的表征。
  • 考察在低资源事件抽取场景下,利用大规模未标注数据进行预训练对模型性能的影响。

提出的方法

  • 模型使用字符级词嵌入作为输入特征,替代人工设计的语言学特征(如词性标注、句法结构和命名实体)。
  • 采用随机梯度下降进行反向传播,端到端训练深度神经网络,以学习输入字符的抽象分布式表征。
  • 在100,000篇未标注的中文新闻文档上,使用基于RNN的skip-gram word2vec框架预先训练词嵌入,随后在标注的事件抽取任务上进行微调。
  • 最终预测采用混合解码策略:将DNN输出视为发射概率,与条件随机场(CRF)模型的转移概率结合,以提升序列标注的准确性。
  • 系统基于Theano实现,该Python深度学习框架支持高效计算与反向传播。

实验结果

研究问题

  • RQ1基于词嵌入的深度神经网络能否在中文事件触发词识别中有效替代人工特征工程?
  • RQ2词嵌入是否为该任务提供比传统语言学特征更具鲁棒性与泛化能力的表征?
  • RQ3在低资源事件抽取场景下,大规模未标注数据预训练在多大程度上提升模型性能?

主要发现

  • 使用词嵌入的DNN模型取得64.29的F1分数,显著优于使用自动生成命名实体的最佳基线ME分类器(F1:61.44)。
  • 与未预训练版本相比,通过未标注数据预训练使DNN的F1分数提升了12.92个百分点(从58.06提升至64.29),证明了无监督预训练的价值。
  • 该模型的召回率(61.14%)高于最佳基线(52.17%),表明词嵌入能有效捕捉语义相似性,有助于识别新出现或罕见的触发词。
  • 最优词嵌入维度约为100,因更小的维度缺乏表征能力,而更大的维度则导致过拟合并降低泛化能力。
  • 即使未使用标准命名实体识别结果,DNN模型仍优于依赖真实标注NER的ME分类器,表明基于嵌入的方法具有更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。