Skip to main content
QUICK REVIEW

[論文レビュー] Improving Coreference Resolution by Learning Entity-Level Distributed Representations

Kevin Clark, Christopher D. Manning|arXiv (Cornell University)|Jun 4, 2016
Natural Language Processing Techniques被引用数 12
ひとこと要約

本論文は、エンティティレベルの推論を向上させるために、コアリファレンスクラスターペairの高密度で分散表現を学習するニューラルコアリファレンス解決システムを提案する。学習による探索フレームワークを用いて、これらの表現に基づき、段階的にクラスタを統合する。最小限の手作業特徴量で、英語と中国語のCoNLL 2012データセットにおいて、それぞれ65.29および63.66の最先端F1スコアを達成した。

ABSTRACT

A long-standing challenge in coreference resolution has been the incorporation of entity-level information - features defined over clusters of mentions instead of mention pairs. We present a neural network based coreference system that produces high-dimensional vector representations for pairs of coreference clusters. Using these representations, our system learns when combining clusters is desirable. We train the system with a learning-to-search algorithm that teaches it which local decisions (cluster merges) will lead to a high-scoring final coreference partition. The system substantially outperforms the current state-of-the-art on the English and Chinese portions of the CoNLL 2012 Shared Task dataset despite using few hand-engineered features.

研究の動機と目的

  • mention-pairベースのシステムでしばしば無視されがちなエンティティレベルの情報をコアリファレンス解決に組み込む課題に対処すること。
  • コアリファレンスクラスターペアの高次元連続表現を学習するニューラルネットワークを開発すること。
  • 局所的に最適な統合決定を下し、グローバルに高得点のコアリファレンスパーティションを生成するように、学習による探索アルゴリズムを用いてモデルを訓練すること。
  • エンティティレベルの分散表現が、特に誤った大規模クラスタ統合を防ぐ点で、複数言語にわたるコアリファレンス解決の性能を顕著に向上させることを示すこと。
  • 低リソース言語(中国語など)にも一般化しやすい、スケーラブルで特徴工学が最小限のシステムを提供すること。

提案手法

  • システムは、単語埋め込み、句構造特徴、距離特徴を用いて、前向きニューラルネットワークに基づくmention-pairエンコーダーを用いて、mentionペアの分散表現を生成する。
  • クラスターペア表現は、2つのクラスタ間のすべてのmentionペア表現をプーリングすることで生成され、クラスタ間の関係を捉える。
  • クラスターランキングモデルは、クラスターペア表現に適用された学習済みニューラルネットワークを用いて、候補となるクラスタ統合をスコア化し、どの統合が有益かをモデルが決定できるようにする。
  • モデルは、SEARNにインspiredされた学習による探索アルゴリズムを用いて訓練され、段階的な統合プロセスをシミュレートし、最終的なコアリファレンススコアを逆伝播させて、局所的統合決定をガイドする。
  • まずmention-rankingモデルを訓練し、それをクラスターランキングモデルの初期化および候補クラスタ統合のプルーニングに用いることで、効率性を向上させる。
  • 高信頼度の統合を優先する「easy-first」クラスターランキング戦略を統合し、標準的なクラスターランキングよりも性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1コアリファレンスクラスターペアの学習済み連続的かつ高次元の表現が、mentionレベルの特徴を上回るコアリファレンス解決性能を向上させることができるか?
  • RQ2ニューラル表現によるエンティティレベル情報の組み込みが、コアリファレンス解決ベンチマークにおける一般化性と性能向上に寄与するか?
  • RQ3学習による探索フレームワークは、グローバルに高品質なパーティションを生成するように、局所的に最適な統合決定を下すインクリメンタルコアリファレンスシステムを効果的に訓練できるか?
  • RQ4エンティティレベル表現を用いたクラスターランキングモデルの性能は、mention-rankingモデルや先行の最先端システムと比較して、多言語コアリファレンスタスクでどうなるか?
  • RQ5easy-first戦略は、クラスターランキングコアリファレンスシステムの性能をどの程度向上させるか?

主な発見

  • クラスターランキングモデルは、英語CoNLL 2012テストセットで65.29のCoNLL F1スコアを達成し、以前の最先端を顕著に上回った。
  • 中国語CoNLL 2012テストセットでは、63.66のCoNLL F1スコアを達成し、先行手法と比較して顕著な改善を示した。
  • クラスターランキングモデルは、mention-rankingモデルを大幅に上回り、コアリファレンス解決におけるエンティティレベル表現の価値を示した。
  • CEAFφ4指標では特に改善が顕著で、これは誤った大規模クラスタ統合を罰する指標であるため、モデルが有害な統合を効果的に回避していることを示している。
  • easy-first戦略の統合によりさらに性能が向上し、高信頼度の統合を優先することでクラスターランキングの有効性が向上していることが示された。
  • 最小限の手作業特徴量で強力な結果を達成したため、一般化性能が高く、低リソース言語への応用可能性も示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。