Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Ranking Model for Entity Coreference Resolution

Xuezhe Ma, Zhengzhong Liu|arXiv (Cornell University)|Mar 15, 2016
Topic Modeling参考文献 32被引用数 8
ひとこと要約

本稿では、言語的特徴に基づいて照応の解釈戦略を区別するための解決モード変数を導入することで、初めての教師なし生成的順序付けモデルを提示する。このモデルはCoNLL-2012英語ベンチマークで58.44%のF1スコアを達成し、スタンフォードの決定的システムを3.01%上回り、教師あり最先端システムとの差を縮めている。

ABSTRACT

Coreference resolution is one of the first stages in deep language understanding and its importance has been well recognized in the natural language processing community. In this paper, we propose a generative, unsupervised ranking model for entity coreference resolution by introducing resolution mode variables. Our unsupervised system achieves 58.44% F1 score of the CoNLL metric on the English data from the CoNLL-2012 shared task (Pradhan et al., 2012), outperforming the Stanford deterministic system (Lee et al., 2013) by 3.01%.

研究の動機と目的

  • 手動でアノテートされた学習データを一切必要としない教師なし共参照解決システムの開発。
  • 教師なしと教師あり共参照解決システムの性能差を埋める。
  • これまで教師あり設定で成功した順序付けモデルを、教師なし生成フレームワークに応用可能かどうかの検討。
  • 人為的ラベルなしで、言語的特徴と生成モデルを用いて共参照解決の正確性を向上させる。

提案手法

  • 各メンションに対して、メンションタイプ、性別、数、能動性、意味的クラス、距離に基づく異なる先行参照解決戦略をモデル化するための解決モード変数を導入。
  • 結合確率をP(D,C) = ∏P(m_j|m_{c_j}) × ∏P(c_j|j)として因数分解する生成的順序付けモデルを提案。これにより、各メンションごとに独立して推論が可能となる。
  • 先行参照スコアリングに、メンションタイプ、性別、数、能動性、意味的クラス、メンション間距離などの言語的特徴の集合を用いる。
  • 順序付けモデルを用いて、各メンションの最も確率の高い先行参照を推定するためのEMに類似した推論手順を適用。
  • 部分的表現、量詞を含む名詞句、および裸の名詞句を保持するが、余分な「it」やその他の不適切なメンションを除外するメンション検出ルールを採用。
  • APWおよびNYTのGigawordコーパス(1994–2010年)を学習に使用し、評価にはCoNLL-2012データを用いる。

実験結果

リサーチクエスチョン

  • RQ1教師なし生成的順序付けモデルは、ラベル付き学習データが一切ない状況でも、共参照解決で競争力のある性能を達成できるか?
  • RQ2解決モード変数は、多様なメンションタイプにわたる先行参照選択のモデリングをどのように改善するか?
  • RQ3教師なし順序付けモデルは、教師あり共参照システムとの性能差をどの程度縮められるか?
  • RQ4性別、数、意味的クラスなどの複数の言語的特徴を組み込むことで、教師なし共参照解決の正確性が向上するか?

主な発見

  • 提案された教師なし順序付けモデルは、CoNLL-2012テストセットで58.44%のCoNLL F1スコアを達成し、スタンフォードの決定的システムを3.01ポイント上回った。
  • 開発セットとテストセットで、それぞれ2.93%および3.01%の向上を達成し、スタンフォードシステムを上回った。
  • 開発セットとテストセットで、それぞれ1.41%および1.77%の向上をマルチグラフ教師なしシステムより達成した。
  • 開発セットとテストセットで、それぞれ2.62%および3.02%の向上をMIR教師なしシステムより達成した。
  • 教師ありIMSシステムよりも1.02%高いCoNLL F1スコアを達成し、最先端の教師ありモデルと比較して優れた性能を示した。
  • 潜在的木モデルと同等の結果を達成し、他の教師ありシステムとの性能差を顕著に縮めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。