Skip to main content
QUICK REVIEW

[論文レビュー] Detecting and Extracting Events from Text Documents

Jugal Kalita|arXiv (Cornell University)|Jan 15, 2016
Topic Modeling参考文献 176被引用数 3
ひとこと要約

この論文は、自然言語処理と機械学習を用いたテキストからのイベント検出および抽出について調査し、要約、バイオメディスン、ソーシャルメディアの応用を想定して、非構造化テキスト内のイベントおよびその参加者を特定することに焦点を当てている。本論文では、波形変換に基づくEDCoWという手法を提案する。この手法は、Twitterデータにおけるバースト的で相関のあるパターンを持つ語のクラスタリングによってイベントを検出する。モジュラリティに基づくグラフ分割と相互相関解析を用いることで、イベント検出の精度が向上する。

ABSTRACT

Events of various kinds are mentioned and discussed in text documents, whether they are books, news articles, blogs or microblog feeds. The paper starts by giving an overview of how events are treated in linguistics and philosophy. We follow this discussion by surveying how events and associated information are handled in computationally. In particular, we look at how textual documents can be mined to extract events and ancillary information. These days, it is mostly through the application of various machine learning techniques. We also discuss applications of event detection and extraction systems, particularly in summarization, in the medical domain and in the context of Twitter posts. We end the paper with a discussion of challenges and future directions.

研究の動機と目的

  • 自然言語処理におけるイベント検出および抽出手法について包括的なサーベイを提供すること。
  • ニュース、バイオメディカルテキスト、ソーシャルメディアなど多様な分野におけるイベント検出の課題を特定すること。
  • 信号処理とグラフ分割を用いて、Twitterにおけるバースト的イベントを検出する新規手法EDCoWを提案し、その評価を行うこと。
  • イベントベースの表現が要約および質問応答システムにおいてどのように有用であるかを示すこと。
  • 現在のシステムにおける限界、特に文間をまたがるイベントを検出できないという点を解決すること。

提案手法

  • EDCoWは、時間領域のデータを時間スケール領域に変換するため、時間窓をスライドさせながら語の頻度信号をウェーブレット表現に変換する。
  • イベント検出の前に、自己相関を適用して意味が薄い、低重要度の語を除外する。
  • 語の類似度は相互相関を用いて計算され、信号の類似性を表す対称的かつスパースな相関行列が形成される。
  • ノードを語、エッジを相互相関とするグラフ分割問題を解くことでイベントを検出する。最適化基準としてモジュラリティが用いられる。
  • モジュラリティ行列を計算し、スケーラビリティを確保するため、パワー反復法を用いて最大固有値および対応する固有ベクトルを求める。
  • イベントは、内部相関が高く、グループ間相関が低い2語以上の語のグループとして定義され、語数と相関強度に基づいて重要度が重み付けされる。

実験結果

リサーチクエスチョン

  • RQ1計算的手法を用いて非構造化テキストからイベントを効果的に検出・抽出する方法は何か?
  • RQ2言語的および哲学的イベントの概念が、計算的イベント検出システムの設計に果たす役割は何か?
  • RQ3ソーシャルメディアのテキストにおけるバースト的パターンをどのようにモデル化し、意味のあるイベントを検出できるか?
  • RQ4イベントベースの表現は、ドキュメント要約および質問応答システムの性能をどの程度向上させ得るか?
  • RQ5現在のイベント抽出システムは、文間をまたがるイベントを処理する際に、どのような限界を抱えているか?

主な発見

  • EDCoWは、ウェーブレット変換とモジュラリティベースのクラスタリングを用いて、Twitterデータにおけるイベントを効果的に検出できた。
  • 自己相関による低重要度語の除外と、高相関語クラスタへの注目により、イベント検出の精度が向上した。
  • 語数と相互相関の組み合わせにより、イベントの重要度が定量化され、無関係なイベントと意味のあるイベントの区別が可能になった。
  • 固有値計算にパワー反復法を用いることで、大規模なテキストストリームにおける語数の増加に対しても、EDCoWは効率的にスケーリングできた。
  • モジュラリティを用いたグラフ分割によるイベント検出は、ランダムなエッジ割り当てよりも優れており、内部結合性と外部分離性を測るモジュラリティ指標の有効性が示された。
  • イベントベースの表現が要約および質問応答システムの性能向上に寄与することを、ベースラインのbag-of-wordsモデルとの比較によって実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。