[論文レビュー] Annotating Character Relationships in Literary Texts
本稿では、ホメロスの『イリアス』からジョイスの『ピスゲット』まで109編の文学的テキストにおける手作業によるキャラクター関係の大型オープンデータセットを提示する。アマゾン・メカニカル・トルクを用いて非専門家のアノテーターが、SparkNotesの要約に基づいて関係性を評価した。主な貢献は、粗い分類において$κ = 0.812$、細かい分類において$κ = 0.744$という高い正確性を持つデータセットを提供することであり、文学的関係抽出のためのNLPモデルのトレーニングおよび評価を可能にする。
We present a dataset of manually annotated relationships between characters in literary texts, in order to support the training and evaluation of automatic methods for relation type prediction in this domain (Makazhanov et al., 2014; Kokkinakis, 2013) and the broader computational analysis of literary character (Elson et al., 2010; Bamman et al., 2014; Vala et al., 2015; Flekova and Gurevych, 2015). In this work, we solicit annotations from workers on Amazon Mechanical Turk for 109 texts ranging from Homer's _Iliad_ to Joyce's _Ulysses_ on four dimensions of interest: for a given pair of characters, we collect judgments as to the coarse-grained category (professional, social, familial), fine-grained category (friend, lover, parent, rival, employer), and affinity (positive, negative, neutral) that describes their primary relationship in a text. We do not assume that this relationship is static; we also collect judgments as to whether it changes at any point in the course of the text.
研究の動機と目的
- 文学的テキストにおけるキャラクター関係の大型オープンデータセットを構築し、自動関係予測モデルのトレーニングおよび評価を支援すること。
- 非専門家アノテーターが本文ではなく第三者の要約(例:SparkNotes)に依存する場合の実行可能性を評価すること。
- 関係性のダイナミクス、特に時間経過に伴う変化および感情的傾向(肯定的、否定的、中立的)を特定すること。
- 多様な文学的作品にわたるキャラクターおよびその相互作用の計算的分析の基盤を提供すること。
- 物語理解、キャラクターネットワーク分析、および文学における関係タイプ予測に関する今後の研究を可能にすること。
提案手法
- アマゾン・メカニカル・トルクのアノテーターが、本文ではなくSparkNotesの要約に基づいて、キャラクター間の二項関係を評価した。
- 4つのアノテーション次元を収集した:親密さ(肯定的、否定的、中立的)、粗い分類(家族的、社会的、職業的)、細かい種別(例:友人、両親、同僚)、関係変化(有無および説明)。
- 各テキストは複数の作業者によってアノテートされ、109作品にわたって合計2,170件のアノテーションが収集された。そのうち392組の二項関係が2名の独立したアノテーターによる評価を受け、一貫性の評価が可能となった。
- アノテーター間一貫性は、偶然の影響を補正するためのフレイスの$κ$を用いて測定され、アノテーションタイプごとに結果が報告された。
- すべてのデータ(匿名化された作業者IDを含む生データ)は、http://github.com/dbamman/characterRelations で公開されている。
- このデータセットは、ホメロス、シェイクスピア、オースティン、トールストイ、ジョイスなど、多様な著者と時代の作品をカバーしており、広範な文学的カバレッジを確保している。
実験結果
リサーチクエスチョン
- RQ1非専門家アノテーターは、要約レベルの情報のみを用いて、文学的テキストにおけるキャラクター関係を信頼性高く特定・分類できるか?
- RQ2要約に基づくアノテーションにおいて、粗い分類および細かい分類の関係カテゴリでどの程度の一致が達成できるか?
- RQ3文学的テキストの進行に伴い、キャラクター関係がどの程度頻繁に変化するか、そしてその変化はどの程度信頼性高く検出できるか?
- RQ4幅広い文学的作品にわたる関係タイプ(親密さ、分類、種別)の分布はどのようなものか?
- RQ5非専門家アノテーターによる感情(親密さ)の判断は、どの程度一貫性を示すか?
主な発見
- 粗い分類のアノテーター間一貫性は高く、フレイスの$κ = 0.812$であった。これはアノテーター間の強い一貫性を示している。
- 細かい関係種別のアノテーションは著しい一致を示し($\u03ba = 0.744$)、『夫婦』や『同僚』といった特定の関係タイプの分類が信頼性を持って行えることを示している。
- 18.1%のキャラクター二項関係が、テキスト全体を通じて顕著な関係変化を経験したと判断されたが、偶然補正後の一致度は低く($\u03ba = 0.208$)あった。
- 親密さのアノテーションは最も低い一致度を示した($\u03ba = 0.364$)、非専門家にとって感情に基づく判断が特に困難であることを示している。
- 109編の文学的テキストに合計2,170件のアノテーションが収集され、そのうち392組の二項関係が2名の独立したアノテーターによる評価を受け、信頼性の評価が可能となった。
- すべてのデータは、匿名化された作業者IDを含む生データを含めて、http://github.com/dbamman/characterRelations で公開されており、再現性およびさらなる研究を支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。