[論文レビュー] Robust Quantification of Gender Disparity in Pre-Modern English Literature using Natural Language Processing
本研究では、1850年から1950年までの前近代的英語文学(1850–1950)において、Project Gutenberg コーパスを用いてオープンソースのNLPツールを適用し、性別による格差を強固に定量化した。その結果、男性キャラクターに比べて女性キャラクターの出現頻度が顕著に低いことが判明した。性別による格差は、著者の性別を制御すると軽減される傾向にあり、女性著者がより性別に偏らないキャラクター表現を生み出している可能性が示唆された。
Research has continued to shed light on the extent and significance of gender disparity in social, cultural and economic spheres. More recently, computational tools from the Natural Language Processing (NLP) literature have been proposed for measuring such disparity using relatively extensive datasets and empirically rigorous methodologies. In this paper, we contribute to this line of research by studying gender disparity, at scale, in copyright-expired literary texts published in the pre-modern period (defined in this work as the period ranging from the mid-nineteenth through the mid-twentieth century). One of the challenges in using such tools is to ensure quality control, and by extension, trustworthy statistical analysis. Another challenge is in using materials and methods that are publicly available and have been established for some time, both to ensure that they can be used and vetted in the future, and also, to add confidence to the methodology itself. We present our solution to addressing these challenges, and using multiple measures, demonstrate the significant discrepancy between the prevalence of female characters and male characters in pre-modern literature. The evidence suggests that the discrepancy declines when the author is female. The discrepancy seems to be relatively stable as we plot data over the decades in this century-long period. Finally, we aim to carefully describe both the limitations and ethical caveats associated with this study, and others like it.
研究の動機と目的
- 計算的手法を用いて、前近代的英語文学テキストにおけるキャラクター表現の性別格差を定量的に測定すること。
- 複数の独立した測定法と厳密な統計的分析を用いることで、研究手法の妥当性を確保すること。
- 著者の性別が、キャラクター表現における性別格差に影響を与えるかどうかを調査すること。
- 1850年から1950年の100年間にわたる性別表現の時間的傾向を評価すること。
- 非二元性やジェンダーに反するアイデンティティを含む、特に倫理的懸念やメソドロジ的制限を批判的に検討・公表すること。
提案手法
- 著作権が切れた1850年から1950年までの英語文学テキストを含むオープンソースのProject Gutenberg英語コーパスを用いた。
- 産業用途に適したオープンソースのNLPパッケージを用いて、複数段階のNLPパイプラインを実装し、キャラクターおよび代名詞の性別を分類した。
- 性別ごとのキャラクター出現頻度を測るための3つの異なる指標を適用した:(1) 名前が付いたキャラクターの数、(2) キャラクターの言及回数、(3) 代名詞使用の統計。
- 代表的なサンプルを手動でアノテートすることで、性別分類の正確性を推定し、名前の分類ではほぼ完璧な結果が得られた。
- 時間帯ごとおよび著者の性別ごとに統計的分析を実施し、傾向や条件付き効果を検証した。
- 研究コミュニティによる再現性と今後の検証を促すために、すべてのコードとデータを公開した。
実験結果
リサーチクエスチョン
- RQ1前近代的英語文学において、女性キャラクターの出現頻度は男性キャラクターに比べて顕著に低いと言えるか?
- RQ2著者の性別を制御した場合、キャラクター表現における性別格差は減少するか?
- RQ31850年から1950年の間で、女性対男性キャラクターの出現頻度比に時間的変化が顕著に見られるか?
- RQ4名前ベースの性別推定といった、メソドロジ的選択や仮定が、研究結果の信頼性にどの程度影響を与えるか?
- RQ5非二元的およびジェンダーに反するアイデンティティを含む文学コーパスにおける性別格差の測定に関して、倫理的およびメソドロジ的制限は何か?
主な発見
- 本研究で用いた3つの頻度測定指標すべてにおいて、女性キャラクターの出現頻度は男性キャラクターに比べて顕著に低いことが判明した。
- 著者の性別を制御した分析では、性別格差は著しく軽減されたが、依然として有意であった。
- 1850年から1950年の100年間にわたり、男性対女性キャラクターの出現頻度比は比較的安定しており、時間の経過とともに女性キャラクターの出現頻度が上昇した兆候は認められなかった。
- 現在のNLP文書において、非二元的またはジェンダーに反するキャラクターを正確に同定する手法は存在しないことが判明し、既存ツールにおける深刻な空白が浮き彫りになった。
- 性別分類の正確性の推定値は、小規模な手動サンプルから得られたものであり、著者らは、さらなる検証が行われない限り、これらの数値に盲目的に依存すべきではないと警告している。
- 著者らは、仮説の設定や測定法の選択といったメソドロジ的選択が結果に影響を与える可能性があると強調し、今後の再現性の確保や代替的フレームワークの検討を提言している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。