Skip to main content
QUICK REVIEW

[論文レビュー] Scale Up Event Extraction Learning via Automatic Training Data Generation

Ying Zeng, Yansong Feng|arXiv (Cornell University)|Dec 11, 2017
Topic Modeling参考文献 21被引用数 3
ひとこと要約

本稿では、Freebase や Wikipedia のテーブルなどの構造化知識ベースを活用して、手動のアノテーションを必要とせず、高品質なトレーニングデータを自動生成する遠隔教師付きアプローチを提案する。明示的なトリガーではなく、キーアーギュメントを用いることで、トレーニングデータを数千件から数十万件にスケーリングし、後処理による推論を組み込んだニューラルモデルにより、最小限の人的努力でマルチタイプのイベント検出において最先端の性能を達成する。

ABSTRACT

The task of event extraction has long been investigated in a supervised learning paradigm, which is bound by the number and the quality of the training instances. Existing training data must be manually generated through a combination of expert domain knowledge and extensive human involvement. However, due to drastic efforts required in annotating text, the resultant datasets are usually small, which severally affects the quality of the learned model, making it hard to generalize. Our work develops an automatic approach for generating training data for event extraction. Our approach allows us to scale up event extraction training instances from thousands to hundreds of thousands, and it does this at a much lower cost than a manual approach. We achieve this by employing distant supervision to automatically create event annotations from unlabelled text using existing structured knowledge bases or tables.We then develop a neural network model with post inference to transfer the knowledge extracted from structured knowledge bases to automatically annotate typed events with corresponding arguments in text.We evaluate our approach by using the knowledge extracted from Freebase to label texts from Wikipedia articles. Experimental results show that our approach can generate a large number of high quality training instances. We show that this large volume of training data not only leads to a better event extractor, but also allows us to detect multiple typed events.

研究の動機と目的

  • 教師付きイベント抽出における小規模で手動アノテートされたトレーニングデータセットのボトル neck を解消すること。
  • 構造化知識ベースからのキーアーギュメントに依存することで、人的にアノテートされたイベントトリガーの必要性を排除すること。
  • 遠隔教師付き手法を用いて、構造化テーブルを活用し、イベント抽出のトレーニングデータを数千件から数十万件にスケーリングすること。
  • 大規模に自動生成されたトレーニングデータを活用することで、効果的なマルチタイプのイベント検出を実現すること。
  • 明示的なトリガー識別に依存しないニューラルネットワークモデルを、後処理による推論を組み合わせて開発すること。

提案手法

  • イベントタイプを定義するキーアーギュメントを、構造化知識ベース(例:Freebase、Wikipedia テーブル)から特定する。
  • これらのキーアーギュメントをイベントタイプの代理として用い、未構造化テキスト(例:Wikipedia 記事)を自動的にラベル付けることで、遠隔教師付き手法を適用する。
  • イベントタイプを最もよく特徴付ける最も情報量の多いキーアーギュメントを特定するためのヒューリスティクスを設計する。
  • 明示的なイベントトリガーに依存せずにイベント抽出を実行するニューラルネットワークアーキテクチャ(BLSTM-CRF-ILP)を開発する。
  • 予測の整合性を保証するために、後処理における推論に線形整数プログラミング(ILP)を用いる。
  • 固有表現および時系列的・構文的手がかりに基づいて、テキストのスパンと構造化テーブルのエントリを照合することで、トレーニングデータを生成する。

実験結果

リサーチクエスチョン

  • RQ1構造化知識ベースからのキーアーギュメントを用いて、明示的なトリガーのアノテーションなしにイベントタイプを推定できるか?
  • RQ2構造化テーブルを用いた遠隔教師付き手法が、イベント抽出のための高品質なトレーニングデータをどの程度生成できるか?
  • RQ3自動生成されたデータでトレーニングされたニューラルモデルは、複数のイベントタイプを効果的に検出できるか?
  • RQ4F1スコアの観点から、本手法の性能は人的にアノテートされたデータセットと比較してどの程度か?(イベントタイプ分類およびアーギュメント検出の観点で)
  • RQ5テーブルベースの監視にのみ依存する場合でも、本モデルはビジネス買収、オリンピックでの勝利、および賞の授与など、多様なイベントタイプに一般化できるか?

主な発見

  • 提案手法により、広く使われている ACE Challenge データセットよりも 14 倍大きなトレーニングデータセットが、数時間で構築された。
  • 自動生成されたトレーニングデータは、人的にアノテートされたデータと同等の F1 スコアを達成し、買収イベントでは 87.0%、オリンピックイベントでは 77.2%、賞の授与イベントでは 95.0% の F1 スコアを記録した。
  • TBWiki データセットにおいて、キーアーギュメント検出(KAD)で 72.0%、すべてのアーギュメント検出(AAD)で 69.6% の F1 スコアを達成し、優れた一般化性能を示した。
  • 本手法により、従来の手法がほとんど対応していないマルチタイプのイベント検出が効果的に可能になった。
  • トリガーではなくキーアーギュメントを用いることで、たとえば「破綻」や「提出」などの動詞を含まない文においても、イベントを検出できるようになった。
  • ILP を用いた後処理による推論の統合により、アーギュメントの一貫性と全体的な抽出品質が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。