Skip to main content
QUICK REVIEW

[論文レビュー] KnowDis: Knowledge Enhanced Data Augmentation for Event Causality Detection via Distant Supervision

Xinyu Zuo, Yubo Chen|arXiv (Cornell University)|Oct 21, 2020
Topic Modeling参考文献 27被引用数 6
ひとこと要約

KnowDis は、語彙的および因果的コンモンセンス知識を活用して高品質な学習データを自動生成する、知識強化型の遠隔教師付きフレームワークを提唱する。Lexicon-Enhanced Annotator、Common Sense Filter、再ラベル付け/冷却戦略を統合することで、KnowDis は EventStoryLine および Causal-TimeBank データセットにおいて遠隔ラベル付きデータを用いて、最先端の性能を大幅に向上させた。

ABSTRACT

Modern models of event causality detection (ECD) are mainly based on supervised learning from small hand-labeled corpora. However, hand-labeled training data is expensive to produce, low coverage of causal expressions and limited in size, which makes supervised methods hard to detect causal relations between events. To solve this data lacking problem, we investigate a data augmentation framework for ECD, dubbed as Knowledge Enhanced Distant Data Augmentation (KnowDis). Experimental results on two benchmark datasets EventStoryLine corpus and Causal-TimeBank show that 1) KnowDis can augment available training data assisted with the lexical and causal commonsense knowledge for ECD via distant supervision, and 2) our method outperforms previous methods by a large margin assisted with automatically labeled training data.

研究の動機と目的

  • イベント因果関係検出(ECD)における手動ラベル付き学習データの不足がモデル性能を制限するという問題に対処する。
  • 既存の ECD データセットのカバー範囲の狭さとスケールの小ささを、高品質な学習例を自動生成することで克服する。
  • 語彙的および因果的コンモンセンス知識を統合することで、ノイズを低減し、因果的意味表現を強化することで、遠隔ラベル付きデータの品質を向上させる。
  • ノイズを含む遠隔教師付きデータを効果的に活用するための、フィルタリング、再ラベル付け、冷却戦略を組み合わせた堅牢なデータ拡張パイプラインを開発する。
  • 知識強化型の自動ラベル付き学習データを用いて、ECDベンチマークで最先端の性能を達成する。

提案手法

  • Lexicon-Enhanced Annotator(LexiAnno)は、同義語、上位概念、動詞クラスの類似性を用いて WordNet および VerbNet から因果的イベントペアを抽出し、学習信号を拡張する。
  • Common Sense Filter(CommonFilter)は、因果的コンモンセンス知識を活用して遠隔ラベル付き文を精緻化し、因果表現の文法的整合性を向上させる。
  • ノイズ低減と遠隔ラベル付きデータにおけるモデル一般化性能の向上のため、再ラベル付けおよび冷却戦略が適用される。
  • フレームワークは、transEベースの埋め込み類似度と最大間隔損失を用い、高確率の因果的イベントペアをランク付け・選択して遠隔ラベル付けに使用する。
  • 遠隔教師付き手法は NYT コーパスに適用され、アノテート済みおよび抽出済みのイベントペアを含むランダムに選択された文の 5% が学習データとしてラベル付けされる。
  • 最終モデルは、人為的アノテーションデータと知識拡張型遠隔学習データの組み合わせで訓練され、再ラベル付けおよび学習率の冷却を繰り返し適用することで反復的改善が行われる。

実験結果

リサーチクエスチョン

  • RQ1WordNet および VerbNet からの語彙的知識を、ECD におけるデータ拡張のための多数の高確率因果イベントペアを生成するために効果的に活用できるか?
  • RQ2因果的コンモンセンス知識は、特に意味的整合性の観点から、ECD における遠隔ラベル付き文の品質をどのように向上させ得るか?
  • RQ3再ラベル付けおよび冷却戦略は、遠隔教師付き ECD データにおけるノイズ低減とモデル性能向上にどの程度寄与するか?
  • RQ4知識拡張型遠隔教師付き手法を統合することで、完全教師ありまたは知識なし弱教師あり手法に比べ、ECDベンチマークで顕著な性能向上が達成できるか?
  • RQ5知識の効果的統合とノイズ蓄積のバランスを取る最適な遠隔学習データの保持割合はどの程度か?

主な発見

  • KnowDis は EventStoryLine コーパスにおいて、49.7 の新たな最先端 F1 スコアを達成し、前回最良手法より 4.4 ポints 高上した。
  • LexiAnno を通じた抽出因果イベントペアの導入により、アノテート済みペアのみを用いた場合に比べ、F1 が 4.4 ポイント向上した。これは知識拡張の価値を示している。
  • Common Sense Filter を除外すると F1 が 1.6 ポイント低下し、因果的コンモンセンス知識が語彙的接続語よりも、遠隔ラベル付きデータの精緻化に優れていることを示している。
  • 再ラベル付けおよび冷却戦略の両方が性能向上に寄与しており、再ラベル付けはノイズ低減に、冷却戦略はノイズを含むデータにおけるモデル収束性の向上に寄与している。
  • 因果グループからの遠隔学習データの 50% を保持した場合に最適な性能が達成された。これ以上の保持率は、追加の知識の恩恵を超えてノイズが蓄積されるため不適切である。
  • 因果知識を欠いた EDA ベースのデータ拡張手法に比べ、本手法は顕著に優れた性能を示し、データ拡張において因果固有の知識統合の必要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。