[論文レビュー] An Annotated Dataset of Coreference in English Literature
本稿では、100部の英語文学作品から構成され、合計210,532語のコアリファレンスアノテーションデータセットであるLitBankを紹介する。本データセットは、平均2,105語の長文を含み、複雑なコアリファレンス現象を特徴としている。ドメイン内文学データで学習させた場合、OntoNotesと比較してFスコアが6ポイント向上し、PreCoと同等の性能を示すが、データ量は2桁少ない。
We present in this work a new dataset of coreference annotations for works of literature in English, covering 29,103 mentions in 210,532 tokens from 100 works of fiction. This dataset differs from previous coreference datasets in containing documents whose average length (2,105.3 words) is four times longer than other benchmark datasets (463.7 for OntoNotes), and contains examples of difficult coreference problems common in literature. This dataset allows for an evaluation of cross-domain performance for the task of coreference resolution, and analysis into the characteristics of long-distance within-document coreference.
研究の動機と目的
- 英語文学分野における堅牢なコアリファレンスアノテーションリソースの不足に応えること。文学分野ではコアリファレンス行動が標準ベンチマークとは顕著に異なる。
- 長編文学的テキストにおけるコアリファレンス認識システムの評価を可能にすること。長距離代名詞や物語的認識論的要因を含む、独自の課題を有する。
- 文学におけるコアリファレンスパターンの分析、特にエンティティのバーストネス、先行語距離分布、およびメンションタイプの行動特性。
- 神経コアリファレンスモデルの文学的文脈におけるドメイン内データとドメイン外データの学習効果の評価。
- キャラクターやエンティティ分析のための信頼性の高いコアリファレンスアノテーションを提供することで、計算的文学研究を支援すること。
提案手法
- ACEカテゴリ(人物、場所、組織、施設、地理政治的エンティティ、車両)に跨るコアリファレンス関係を、LitBankの100部の文学的テキストにアノテート。
- BERTコンテキスト埋め込みを用いたレイヤードBiLSTM-CRFモデルを用い、生テキストからメンション境界を予測。メンション検出では89.1のFスコアを達成。
- LitBank、OntoNotes、PreCoのアノテート済みデータを用いてニューラルコアリファレンス認識システムを学習させ、クロスドメイン性能を比較。
- 十分割交差検証を実施し、予測されたメンションを前提とした現実的な条件下でメンション同定およびコアリファレンス認識の性能を評価。
- 先行語距離分布とエンティティ活動パターンを測定し、文学的長距離言語現象を特徴づける。
- 標準的なコアリファレンスメトリクス(B3、MUC、CEAF φ4)とその平均Fスコアを用いてモデル性能を評価。
実験結果
リサーチクエスチョン
- RQ1ドメイン内文学データ(LitBank)で学習する場合と、ドメイン外ベンチマーク(OntoNotes)で学習する場合とで、コアリファレンス認識性能はどのように変化するか?
- RQ2長編文学的テキストにおける先行語距離分布とエンティティ活動スパンの分布的特性は何か?
- RQ3異なるメンションタイプ(例:代名詞、固有名詞)は、先行語への近接性や解釈の難易度においてどのように振る舞うか?
- RQ4ドメインの違いがあるにもかかわらず、大規模なドメイン外データセット(PreCo)が文学的コアリファレンスに効果的に一般化できるか?
- RQ5メンション境界予測の正確性が、文学的テキストにおける下流のコアリファレンス認識性能にどの程度影響を与えるか?
主な発見
- ドメイン内文学データ(LitBank)で学習した場合、Fスコアは68.1を記録し、OntoNotesで学習した場合(62.9)と比較して6ポイント向上。ドメイン特化データの価値を示している。
- PreCo(67.6 Fスコア)と同等の性能を達成しているが、PreCoはデータ量が2桁多い。これは大規模なドメイン外データが強力な一般化能力を持つことを示唆している。
- 代名詞は95%の確率で9語以内の先行語にリンクしており、文学的テキストにおける高い局所的整合性を示している。
- 文学的テキストにおけるエンティティは、非常に短いまたは非常に長いスパンで活動するという二峰性の活動パターンを示しており、バースト性と長期的持続性を示している。
- BERTを強化したBiLSTM-CRFによるメンション同定は89.1のFスコアを達成。エンティティクラスや品詞予測の際には性能がわずかに低下するにとどまる。
- 本データセットは、文学的長文に複雑なコアリファレンスパターンが存在することを明らかにした。特に、存在論的・認識論的要因によるアイデンティティや知識の変化が、標準的なコアリファレンスシステムに挑戦をもたらす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。