Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Quantification of Gender Disparity in Pre-Modern English Literature using Natural Language Processing

Akarsh Nagaraj, Mayank Kejriwal|arXiv (Cornell University)|2022. 04. 12.
Computational and Text Analysis Methods인용 수 5
한 줄 요약

이 연구는 1850~1950년 기간의 고전 영문학 문학자료집인 Project Gutenberg 코퍼스를 대상으로 오픈소스 NLP 도구를 사용하여 사전현대 영문학에서 성별 격차를 강력하게 정량화한다. 그 결과, 남성 캐릭터에 비해 여성 캐릭터의 출현 빈도가 유의미하게 낮게 나타났다. 성별 격차는 저자 성별을 통제할 경우 감소함을 확인하여, 여성 저자가 더 균형 잡힌 성별 표현을 하는 경향이 있음을 시사한다.

ABSTRACT

Research has continued to shed light on the extent and significance of gender disparity in social, cultural and economic spheres. More recently, computational tools from the Natural Language Processing (NLP) literature have been proposed for measuring such disparity using relatively extensive datasets and empirically rigorous methodologies. In this paper, we contribute to this line of research by studying gender disparity, at scale, in copyright-expired literary texts published in the pre-modern period (defined in this work as the period ranging from the mid-nineteenth through the mid-twentieth century). One of the challenges in using such tools is to ensure quality control, and by extension, trustworthy statistical analysis. Another challenge is in using materials and methods that are publicly available and have been established for some time, both to ensure that they can be used and vetted in the future, and also, to add confidence to the methodology itself. We present our solution to addressing these challenges, and using multiple measures, demonstrate the significant discrepancy between the prevalence of female characters and male characters in pre-modern literature. The evidence suggests that the discrepancy declines when the author is female. The discrepancy seems to be relatively stable as we plot data over the decades in this century-long period. Finally, we aim to carefully describe both the limitations and ethical caveats associated with this study, and others like it.

연구 동기 및 목표

  • 컴퓨터 기반 방법을 사용하여 사전현대 영문학 텍스트의 캐릭터 표현에서 성별 격차를 정량적으로 측정하는 것.
  • 여러 개별 측정 방법과 철저한 통계 분석을 통해 방법론의 강건성을 확보하는 것.
  • 저자의 성별이 캐릭터 표현의 성별 격차에 영향을 미치는지 조사하는 것.
  • 1850년에서 1950년 사이 100년 동안의 성별 표현 추세를 분석하는 것.
  • 비이원성 및 성전환성 정체성을 포함한 윤리적 문제와 방법론적 제약 조건을 비판적으로 검토하고 공개하는 것.

제안 방법

  • 1850년에서 1950년 사이에 출간된 저작권이 만료된 영문학적 텍스트를 포함하는 오픈소스 Project Gutenberg 영문학 코퍼스를 사용하였다.
  • 산업용 오픈소스 NLP 패키지를 활용하여 다단계 NLP 파이프라인을 구현하여 캐릭터와 대명사를 성별로 분류하였다.
  • 성별 기반 캐릭터 출현 빈도를 측정하기 위해 세 가지 별도의 지표를 적용하였다: (1) 명시된 캐릭터 수, (2) 캐릭터 언급 수, (3) 대명사 사용 포함.
  • 대표 샘플에 대한 수동 주석을 통해 성별 분류 정확도를 추정하였으며, 이름 기반 분류에서는 거의 완벽한 결과를 얻었다.
  • 시간대별 및 저자 성별에 따라 통계 분석을 수행하여 추세 및 조건부 영향을 검증하였다.
  • 모든 코드와 데이터를 공개하여 연구 공동체의 재현 가능성과 향후 검토를 보장하였다.

실험 결과

연구 질문

  • RQ1사전현대 영문학에서 여성 캐릭터의 출현 빈도가 남성 캐릭터에 비해 유의미하게 낮은가?
  • RQ2저자의 성별을 통제할 경우 캐릭터 표현의 성별 격차가 감소하는가?
  • RQ31850년에서 1950년 사이에 여성 대 남성 캐릭터 출현 비율이 유의미하게 변화했는가?
  • RQ4이전 NLP 문헌에서 비이원성 또는 성전환성 정체성을 정확히 탐지할 수 있는 방법이 존재하는가? 이는 기존 도구의 심각한 격차를 드러낸다.
  • RQ5비이원성 및 성전환성 정체성을 포함한 문학 코퍼스에서 성별 격차를 측정할 때의 윤리적 및 방법론적 제약 조건은 무엇인가?

주요 결과

  • 본 연구에서 사용한 세 가지 출현 빈도 측정 지표 전반에서 여성 캐릭터의 출현 빈도가 남성 캐릭터에 비해 유의미하게 낮게 나타났다.
  • 저자의 성별을 통제할 경우 성별 표현 격차는 상당히 감소하였지만 여전히 유의미하게 남아 있었다.
  • 1850년에서 1950년 사이 100년 동안 남성 대 여성 캐릭터 출현 비율은 비교적 안정적으로 유지되었으며, 시간이 지남에 따라 여성 캐릭터 비율이 증가하는 추세는 없었다.
  • 현재 NLP 문헌에서 비이원성 또는 성전환성 정체성을 정확히 탐지할 수 있는 신뢰할 수 있는 방법이 존재하지 않음을 발견하여, 기존 도구의 심각한 격차를 드러냈다.
  • 성별 분류 정확도 추정치는 소규모 수동 샘플에서 유도되었으며, 연구자들은 추가 검증 없이 이러한 수치에 맹신하지 말 것을 경고한다.
  • 연구자들은 가설 설정 및 측정 방법 선택과 같은 방법론적 선택이 결과에 영향을 줄 수 있으며, 향후 재현 및 다른 수식화를 통해 강건성을 확보해야 한다고 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.