Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Document Event Coreference Resolution Beyond Corpus-Tailored Systems.

Michael Bugert, Nils Reimers|arXiv (Cornell University)|Nov 24, 2020
Topic Modeling参考文献 44被引用数 5
ひとこと要約

本稿は、ECB+、Gun Violence、Football Coreferenceの3つの多様なコーパスにおいて、クロスドキュメントイベントコアリフレンス解決(CDCR)を評価し、ECB+で訓練されたニューラルモデルと一様な特徴ベースのシステムを比較している。絶対的性能は低かったが、特徴ベースのシステムはドメイン間でより良い一般化を示し、既存のニューラルシステムがコーパス固有のパターンに過学習していることが明らかになった。また、CDCRの一般化を高めるために、複数コーパスを用いた評価の重要性を提唱している。

ABSTRACT

Cross-document event coreference resolution (CDCR) is an NLP task in which mentions of events need to be identified and clustered throughout a collection of documents. CDCR aims to benefit downstream multi-document applications, but despite recent progress on corpora and model development, downstream improvements from applying CDCR have not been shown yet. The reason lies in the fact that every CDCR system released to date was developed, trained, and tested only on a single respective corpus. This raises strong concerns on their generalizability --- a must-have for downstream applications where the magnitude of domains or event mentions is likely to exceed those found in a curated corpus. To approach this issue, we define a uniform evaluation setup involving three CDCR corpora: ECB+, the Gun Violence Corpus and the Football Coreference Corpus (which we reannotate on token level to make our analysis possible). We compare a corpus-independent, feature-based system against a recent neural system developed for ECB+. Whilst being inferior in absolute numbers, the feature-based system shows more consistent performance across all corpora whereas the neural system is hit-and-miss. Via model introspection, we find that the importance of event actions, event time, etc. for resolving coreference in practice varies greatly between the corpora. Additional analysis shows that several systems overfit on the structure of the ECB+ corpus. We conclude with recommendations on how to move beyond corpus-tailored CDCR systems in the future -- the most important being that evaluation on multiple CDCR corpora is strongly necessary. To facilitate future research, we release our dataset, annotation guidelines, and model implementation to the public.

研究の動機と目的

  • 既存のCDCRシステムに一般化の欠如があるという問題に取り組む。これらのシステムは通常、1つのコーパスでのみ訓練・評価されている。
  • 1つの一様なCDCRシステムが、多様なドメインやイベントタイプにおいて一貫した性能を示せるかどうかを調査する。
  • ベンチマークコーパスで進展を見せても、なぜ既存のCDCRシステムが下流のアプリケーションを改善できないのかを特定する。
  • 異なるコーパス間でコアリフレンス解決に与える言語的特徴(例:イベント行動、時刻、引数)の役割を分析する。
  • 強力で一般化可能なCDCRシステムを構築するための必須ステップとして、複数コーパスでの評価を促進する。

提案手法

  • 手作業で作成した言語的特徴(イベント行動、時刻表現、引数構造など)を用いた一様な特徴ベースのCDCRシステムを設計した。
  • 他のコーパスと整合性を保つために、Football Coreferenceコーパスをトークンレベルで再アノテーションした。
  • ECB+、Gun Violence、Football Coreferenceの3つの異なるコーパスにおいて、特徴ベースのシステムとECB+で訓練されたニューラルモデルを評価した。
  • モデルの内部構造を分析し、特徴の重要度をコーパスごとに評価し、イベント時刻、行動、引数の重要度がドメインに依存することを明らかにした。
  • クロスコーパス評価を実施し、特にECB+の構造的パターンに依存するニューラルシステムの過学習を検出した。
  • 再アノテーション済みのFootball Coreferenceデータセット、アノテーションガイドライン、モデルコードを公開し、再現性と今後の研究を支援した。

実験結果

リサーチクエスチョン

  • RQ11つの一様な特徴ベースのCDCRシステムは、単一のコーパスに最適化されたニューラルモデルと比較して、複数の多様なコーパスでどの程度の性能を示すか?
  • RQ2イベント行動、時刻表現、引数といった言語的特徴が、異なるドメインにおけるコアリフレンス解決にどの程度寄与するか?
  • RQ3なぜ既存のCDCRシステムは訓練コーパスを超えて一般化できないのか。また、どのような構造的バイアスを示しているのか?
  • RQ4複数コーパス評価は、単一ベンチマークで高い性能を示すが、特定のコーパスに過学習しているニューラルCDCRモデルの過学習をどのように暴露できるか?
  • RQ5コーパスに特化した開発を超えて、一般化可能なCDCRシステムを構築するための主な要件は何か?

主な発見

  • 特徴ベースのCDCRシステムは、絶対的性能は低かったが、3つのコーパスすべてでより一貫した性能を示したのに対し、ニューラルモデルは性能が著しく変動した。
  • ECB+で訓練されたニューラルモデルは、Gun ViolenceおよびFootball Coreferenceコーパスでは性能が著しく低く、強いドメイン固有の過学習が示された。
  • 特徴の重要度はコーパスごとに顕著に異なり、ECB+ではイベント行動が重要だったが、Gun Violenceコーパスでは時刻表現の重要度が高かった。
  • いくつかのCDCRシステム(ニューラルモデルを含む)は、ECB+コーパスの構文的・構造的パターン(特に引数構造と参照表現の分布)に過学習していた。
  • 本研究では、単一コーパスでの評価では一般化能力を適切に評価できないことが示され、信頼性のあるシステム評価のためには複数コーパス評価が不可欠であることが明らかになった。
  • トークンレベルで再アノテーションされたFootball Coreferenceコーパスは、より正確で一貫性のあるクロスコーパス比較を可能にし、今後の研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。