Skip to main content
QUICK REVIEW

[论文解读] Detecting and Extracting Events from Text Documents

Jugal Kalita|arXiv (Cornell University)|Jan 15, 2016
Topic Modeling参考文献 176被引用 3
一句话总结

本文综述了使用机器学习从文本中检测和抽取事件的方法,重点在于从非结构化文本中识别事件及其参与者,应用于摘要生成、生物医学和社交媒体领域。本文提出EDCoW方法,一种基于小波的检测技术,通过聚类Twitter数据中具有突发性、相关性模式的词语来检测事件,利用模块化驱动的图划分和互相关分析提升事件检测效果。

ABSTRACT

Events of various kinds are mentioned and discussed in text documents, whether they are books, news articles, blogs or microblog feeds. The paper starts by giving an overview of how events are treated in linguistics and philosophy. We follow this discussion by surveying how events and associated information are handled in computationally. In particular, we look at how textual documents can be mined to extract events and ancillary information. These days, it is mostly through the application of various machine learning techniques. We also discuss applications of event detection and extraction systems, particularly in summarization, in the medical domain and in the context of Twitter posts. We end the paper with a discussion of challenges and future directions.

研究动机与目标

  • 提供自然语言处理中事件检测与抽取技术的全面综述。
  • 识别在新闻、生物医学文本和社交媒体等多样化领域中检测事件所面临的挑战。
  • 提出并评估EDCoW方法,一种利用信号处理与图划分技术检测Twitter中突发性事件的新型方法。
  • 展示基于事件的表示在摘要生成和问答系统中的实用性。
  • 解决当前系统中的局限性,特别是无法检测跨句子事件的问题。

提出的方法

  • EDCoW通过滑动窗口将随时间变化的词频信号转换为小波表示,将时域数据转换为时频域数据。
  • 在事件检测前,应用自相关分析以过滤掉平凡且显著性低的词语。
  • 通过互相关计算词语相似性,构建对称的稀疏相关矩阵以表示信号间的相似性。
  • 通过求解图划分问题来检测事件,其中节点为词语,边表示互相关性,以模块化作为优化指标。
  • 计算模块化矩阵,并使用幂迭代法求解最大特征值及其对应的特征向量,以保证可扩展性。
  • 事件被定义为至少两个词语组成的群体,其内部相关性高而组间相关性低,显著性由词数和相关性强度加权决定。

实验结果

研究问题

  • RQ1如何利用计算方法有效检测和抽取非结构化文本中的事件?
  • RQ2语言学和哲学中的事件概念在设计计算事件检测系统中起到何种作用?
  • RQ3如何对社交媒体文本中的突发性模式进行建模以检测有意义的事件?
  • RQ4基于事件的表示在多大程度上能提升文档摘要和问答系统的性能?
  • RQ5当前事件抽取系统在处理跨句子事件方面存在哪些局限性?

主要发现

  • EDCoW通过小波变换建模词频突发性,并结合基于模块化的聚类,成功检测出Twitter数据中的事件。
  • 该方法通过自相关分析过滤低显著性词语,并聚焦于高相关性词语聚类,从而提升事件检测效果。
  • 通过结合词语数量与互相关性,量化事件显著性,从而区分平凡事件与有意义事件。
  • 采用幂迭代法进行特征值计算,使EDCoW在大规模文本流中具有高效的可扩展性。
  • 基于模块化的图划分方法在事件检测中优于随机边分配,模块化度量能有效衡量内部凝聚力与外部分离度。
  • 实验表明,基于事件的表示可显著提升摘要生成与问答系统的性能,优于基线的词袋模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。