Skip to main content
QUICK REVIEW

[論文レビュー] MAVEN: A Massive General Domain Event Detection Dataset

Xiaozhi Wang, Ziqi Wang|arXiv (Cornell University)|Apr 28, 2020
Topic Modeling参考文献 64被引用数 5
ひとこと要約

MAVENは、フレームネットを用いて広範な一般ドメインカバレッジを確保するためのフレームに基づく168のイベントタイプを有する、4,480件のウィキペディア文書、118,732件のイベントメンションを含む大規模で人手でアノテートされたイベント検出データセットである。最先端のモデルで評価したところ、顕著な性能低下が見られた。これは、一般ドメインイベント検出がさらなる研究を要する困難な未解決問題のままであることを示している。

ABSTRACT

Event detection (ED), which means identifying event trigger words and classifying event types, is the first and most fundamental step for extracting event knowledge from plain text. Most existing datasets exhibit the following issues that limit further development of ED: (1) Data scarcity. Existing small-scale datasets are not sufficient for training and stably benchmarking increasingly sophisticated modern neural methods. (2) Low coverage. Limited event types of existing datasets cannot well cover general-domain events, which restricts the applications of ED models. To alleviate these problems, we present a MAssive eVENt detection dataset (MAVEN), which contains 4,480 Wikipedia documents, 118,732 event mention instances, and 168 event types. MAVEN alleviates the data scarcity problem and covers much more general event types. We reproduce the recent state-of-the-art ED models and conduct a thorough evaluation on MAVEN. The experimental results show that existing ED methods cannot achieve promising results on MAVEN as on the small datasets, which suggests that ED in the real world remains a challenging task and requires further research efforts. We also discuss further directions for general domain ED with empirical analyses. The source code and dataset can be obtained from https://github.com/THU-KEG/MAVEN-dataset.

研究の動機と目的

  • 既存のイベント検出(ED)データセットが一般ドメインイベントのカバレッジが低く、データ不足に苦しむという制限を是正すること。
  • 現代のニューラルEDモデルのトレーニングとベンチマークに適した大規模で人手でアノテートされたデータセットを構築すること。
  • 狭い専門的スキーマにとどまらず、イベントタイプのカバレッジを拡張することでEDモデルの汎化性能を向上させること。
  • 長尾イベントタイプ、データの不均衡、細分化されたタイプの違いといった課題の実証的分析を可能にすること。
  • 将来的な研究の基盤を提供することを目的とし、複数イベントモデリング、階層的スキーマの活用、EDにおけるトランスファーラーニングを含む。

提案手法

  • フレームネットの文脈フレームを用いて、包括的で人手で検証されたイベントタイプスキーマを定義し、4,480件のウィキペディア文書からMAVENを構築した。
  • フレームネットに基づく階層的ツリー構造のイベントタイプスキーマを定義し、意味的カバレッジを向上させるとともに、細分化された分類を可能にした。
  • 118,732件のイベントメンションをトリガーとともに168種類の異なるイベントタイプにアノテートし、高品質で多様性に富み、一般ドメインに適したカバレッジを確保した。
  • 最先端のニューラルEDモデルを再現し、より現実的で複雑なベンチマーク上で性能を評価した。
  • データの不均衡、階層的スキーマ、複数イベント相関の影響を評価するためにアブレーションスタディおよび実証的分析を実施した。
  • GitHubを通じてデータセットとコードをオープンソースで公開し、再現可能性とコミュニティの採用を促進した。

実験結果

リサーチクエスチョン

  • RQ1最先端のニューラルイベント検出モデルは、ACE 2005のような小さなベンチマークとは対照的に、MAVENのような大規模で一般ドメインのデータセット上でどの程度の性能を示すのか?
  • RQ2データの不均衡と長尾イベントタイプの分布は、実世界のEDタスクにおけるモデルの汎化性能にどの程度の影響を及えるのか?
  • RQ3階層的イベントタイプスキーマは、意味的に類似または密接に関連するイベントタイプを区別する際にモデル性能を向上させることができるか?
  • RQ4MAVENにおけるリソースが限られたイベント検出の状況で、トランスファーラーニングやデータ拡張戦略はどの程度効果的か?
  • RQ5現在のEDモデルが一般ドメインテキストに適用された際の主な失敗モードは何か。また、それらはどのように緩和できるか?

主な発見

  • 最先端のEDモデルは、ACE 2005のような小さなベンチマークと比較して、MAVEN上では顕著な性能低下を示した。これは、現実世界の一般ドメインイベント検出が依然として困難な課題のままであることを示している。
  • 最も一般的な誤りタイプは「識別ミス」であり、モデルがトリガーを検出できなかったり、N/Aとして誤って分類したりするもので、複雑な言語におけるイベント意味の認識に困難を抱えていることを示している。
  • 階層的スキーマにおける親子または兄弟イベントタイプ間で「イベントタイプミス」の割合が高く、モデルが細分化された意味的差異を把握できていないことを示している。
  • 上位50%の頻度の高いイベントタイプへの誤分類が顕著に多く発生しており、モデルがデータの不均衡に偏っており、リソースが限られたタイプへの汎化に失敗していることを示している。
  • 階層的イベントタイプスキーマは、類似したイベントタイプを区別する能力を向上させ、より良いデータバランスと拡張戦略の支援が可能である可能性を示している。
  • 実証的分析から、1文内に複数のイベントをモデル化することは、複雑なテキストにおけるED性能向上の有望な方向性であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。