Skip to main content
QUICK REVIEW

[論文レビュー] A Brief Survey and Comparative Study of Recent Development of Pronoun Coreference Resolution

Hongming Zhang, Xinran Zhao|arXiv (Cornell University)|Sep 27, 2020
Natural Language Processing Techniques参考文献 51被引用数 4
ひとこと要約

本調査では、Winogradスキーマチャレンジのような標準的でないベンチマークを含め、最近の代名詞共参照解決(PCR)における進展を包括的に分析している。その結果、最先端モデルですら、ドメイン間一般化やまれな先行詞に対しては困難を示しており、標準的な指標では高い性能を示しても、常識的推論や耐性の面での限界が浮き彫りになっている。

ABSTRACT

Pronoun Coreference Resolution (PCR) is the task of resolving pronominal expressions to all mentions they refer to. Compared with the general coreference resolution task, the main challenge of PCR is the coreference relation prediction rather than the mention detection. As one important natural language understanding (NLU) component, pronoun resolution is crucial for many downstream tasks and still challenging for existing models, which motivates us to survey existing approaches and think about how to do better. In this survey, we first introduce representative datasets and models for the ordinary pronoun coreference resolution task. Then we focus on recent progress on hard pronoun coreference resolution problems (e.g., Winograd Schema Challenge) to analyze how well current models can understand commonsense. We conduct extensive experiments to show that even though current models are achieving good performance on the standard evaluation set, they are still not ready to be used in real applications (e.g., all SOTA models struggle on correctly resolving pronouns to infrequent objects). All experiment codes are available at https://github.com/HKUST-KnowComp/PCR.

研究の動機と目的

  • 標準的および挑戦的なベンチマークにおける最近の代名詞共参照解決(PCR)の進展を調査すること。
  • 現在のモデルが、Winogradスキーマチャレンジのような難しいケースにおいて、常識的推論をどの程度うまく処理できるかを評価すること。
  • 特に、まれなまたは頻度の低い先行詞やドメイン間一般化において、現在のモデルに見られる主な限界を特定すること。
  • PCRのためのデータセット、モデル、評価プロトコルの統合的概要を提供し、今後の研究を支援すること。
  • 再現可能性の高い研究とモデル改善を促進するため、コードとリソースを公開すること。

提案手法

  • 著者らは、CoNLL-2012や最近のエンドツーエンドモデルを含む、一般的な代名詞共参照解決の代表的データセットとモデルの比較的調査を実施している。
  • 金銭的メンションアノテーションを用いるか、用いないかの2つの設定で、CoNLL-2012データセット上で最先端モデルを評価し、代名詞からメンションへの予測という課題を分離している。
  • 常識的推論の評価として、Winogradスキーマチャレンジ(WSC)におけるモデルのパフォーマンスを分析し、事前学習言語モデルと微調整済みバージョンの間で結果を比較している。
  • 特にリソースが限られた状況やドメイン外の設定において、ハイパーパrameterへの感受性を広範なアブレーションスタディを通じて調査している。
  • 医療、多言語、会話的、ジェンダーバイアス、視覚的認識を考慮したPCRといった、特殊なPCRタスクを調査し、分野特有の課題とデータセットを強調している。
  • すべての実験コードはGitHub経由で公開され、再現性とコミュニティ主導のモデル開発を支援している。

実験結果

リサーチクエスチョン

  • RQ1現在の最先端モデルは、標準的な代名詞共参照解決ベンチマークでどの程度のパフォーマンスを示し、実世界の展開においてどのような限界を示しているのか。
  • RQ2Winogradスキーマチャレンジを用いたテストでは、既存のモデルが常識的推論をどの程度活用して代名詞を解釈できるのか。
  • RQ3標準的な指標で高いパフォーマンスを示しても、なぜモデルは頻度の低いまたはまれな先行詞への代名詞解決で依然として困難を示すのか。
  • RQ4現在のモデルはハイパーパrameterの選択にどの程度感受性を示しており、実用的応用における信頼性に影響を与える可能性があるのか。
  • RQ5医療、会話的、視覚的認識を考慮した設定といった、特殊なPCRタスク間でパフォーマンスにどのような違いが見られるのか。

主な発見

  • 標準的な評価セットでは高いパフォーマンスを示すにもかかわらず、最先端モデルはドメイン間一般化には失敗しており、とくにまれな先行詞への代名詞解決において顕著である。
  • エンドツーエンドモデルは、金銭的メンションなしでCoNLL-2012データセットでF1スコア0.705を達成したが、NP-PおよびNP-NP関係では顕著にパフォーマンスが低下しており、代名詞から名詞句への解決が依然として最も困難なサブタスクであることが示された。
  • すべての最先端モデルが、まれな物体への代名詞解決で困難を示しており、データ効率性と未知語の一般化の面で深刻なギャップが存在することが示唆された。
  • 微調整済み事前学習言語モデルは、Winogradスキーマチャレンジでほぼ人間並みのパフォーマンスを達成したが、ハイパーパrameterの設定に極めて感受性を示しており、実用的応用における信頼性を制限している。
  • 視覚的認識を考慮したPCRタスクでは、会話内の15%の代名詞が言及されていない視覚的対象を指していることが判明し、耐性ある会話理解のためのマルチモーダルな根拠の重要性が浮き彫りになった。
  • 事前学習モデルにはジェンダーバイアスが依然として存在しており、'he'のような代名詞が医師などの男性に関連する役割に不釣り合いに強く関連していることが明らかになり、NLPシステムにおけるバイアス低減の必要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。