Skip to main content
QUICK REVIEW

[論文レビュー] A Benchmark of Rule-Based and Neural Coreference Resolution in Dutch Novels and News

Corbèn Poot, Andreas van Cranenburgh|arXiv (Cornell University)|Nov 3, 2020
Topic Modeling参考文献 35被引用数 10
ひとこと要約

本稿は、オランダ語のニュース/Wikipedia(SoNaR-1)および文学的小説(RiddleCoref)のコーパス上で、ルールベースの共参照システム(dutchcoref)とニューラルエンドツーエンドシステム(e2e-Dutch)をベンチマークした。ニューラルモデルはニューステキストでルールベースのシステムを上回ったが、文学テキストではルールベースのシステムが優れた性能を示し、ドメイン依存の性能差、アノテーション品質、文書長さの影響がオランダ語の共参照解決に及ぼす影響を示している。

ABSTRACT

We evaluate a rule-based (Lee et al., 2013) and neural (Lee et al., 2018) coreference system on Dutch datasets of two domains: literary novels and news/Wikipedia text. The results provide insight into the relative strengths of data-driven and knowledge-driven systems, as well as the influence of domain, document length, and annotation schemes. The neural system performs best on news/Wikipedia text, while the rule-based system performs best on literature. The neural system shows weaknesses with limited training data and long documents, while the rule-based system is affected by annotation differences. The code and models used in this paper are available at https://github.com/andreasvc/crac2020

研究の動機と目的

  • ニュース/Wikipedia および文学的小説という2つの異なるドメインにおけるオランダ語テキストに対して、ルールベースおよびニューラル共参照解決システムの性能を評価・比較すること。
  • ドメインの違い、文書長さ、アノテーション方式が、オランダ語におけるルールベースおよびニューラル共参照システムの性能に与える影響を調査すること。
  • 訓練データ量およびメンション同定の品質が、共参照解決の結果に与える影響を分析すること。
  • アノテーションエラーおよびシングルトンの取り扱いが、システム評価指標に与える影響を評価すること。
  • 既存および新たに導入されたコーパスを用いて、今後のオランダ語共参照解決研究のベンチマークを提供すること。

提案手法

  • オランダ語向けにBERTベースのトークン表現を用いて、エンドツーエンドニューラル共参照システム e2e-Dutch (Lee et al., 2018) を適応した。
  • スタンフォード共参照システムを基盤とするルールベースシステム dutchcoref (van Cranenburgh, 2019) を、両コーパスに適用した。
  • 2つのコーパス(SoNaR-1:ニュース/Wikipedia、581ドキュメント、約100万語;RiddleCoref:文学的小説、23ドキュメント、平均長が長い)でシステムを評価した。
  • ゴールドメンション対予測メンション、シングルトンの含む/含まない、訓練データサイズの変更といった異なる条件下で実験を行った。
  • 両システムの誤字解析を実施し、アノテーションの不整合、メンション境界エラー、欠落した後続参照リンクに焦点を当てた。
  • 標準的な共参照評価指標(MUC、B3、CEAF)を用い、ドメインおよび設定ごとの結果を比較した。

実験結果

リサーチクエスチョン

  • RQ1ルールベースおよびニューラル共参照システムは、オランダ語のニュース/Wikipedia と文学的小説テキストでそれぞれどのように性能を発揮するか?
  • RQ2文書長さおよびコーパスサイズが、オランダ語におけるニューラルおよびルールベース共参照システムの性能に与える影響は何か?
  • RQ3SoNaR-1コーパスにおけるアノテーションの不整合は、システム評価および性能比較にどのような影響を及えるか?
  • RQ4メンション同定の品質が、その後続の共参照解決性能にどの程度影響を及えるか?
  • RQ5シングルトンの取り扱いおよびメンション境界エラーは、システムスコアおよび順位にどの程度影響を及えるか?

主な発見

  • ゴールドメンションを用いた場合、ニューラルシステム(e2e-Dutch)はSoNaR-1で80.61% F1を達成し、ルールベースシステム(70.90% F1)を顕著に上回った。これはニュース/Wikipediaテキストにおける優れた性能を示している。
  • ゴールドメンションを用いた場合、ルールベースシステム(dutchcoref)はRiddleCorefで75.84% F1を達成し、ニューラルシステム(72.01% F1)を上回った。これは文学的小説における優れた性能を示している。
  • ニューラルシステムは、RiddleCorefコーパスの長文ドキュメントにおいて性能の低下を示した。これは、延長された共参照チェーンの処理に限界がある可能性を示唆している。
  • ルールベースシステムはアノテーションの差異により感受性が高く、特にSoNaR-1においてはリンクの欠落や境界の不整合がスコアの低下に寄与した。
  • 評価からシングルトンを除外すると、特にSoNaR-1において、予想に反する大きなスコアの変化が生じた。これは、アノテーション品質および評価設定が結果に強く影響することを示している。
  • 誤字解析により、SoNaR-1に体系的なアノテーションの問題が判明した。具体的には、未リンクの正確な文字列一致(例:'Amsterdam'、'Hilversum')や、欠落したメンション(例:'Japix')が性能差の要因となった可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。