[논문 리뷰] Computational analyses of the topics, sentiments, literariness, creativity and beauty of texts in a large Corpus of English Literature
이 연구는 구텐베르크 문학 영어 코퍼스(GLEC)를 대상으로 계산 기반 방법을 적용하여 6개의 문학 장르와 100명 이상의 저자들 사이에서 주제, 감성, 문학성, 창의성, 인식된 아름다움을 분석한다. 연구는 문학적 복잡성의 새로운 지표인 내문장 변동성(intratextual variance)과 단계적 거리(stepwise distance)를 도입하여 연극이 가장 문학적이며 창의적인 장르로 특정되었으며, 특히 시와 연극이 창의성에서 높은 점수를 기록했다. 또한 에마(*Emma*)는 오스틴의 소설 중에서 가장 아름답다고 예측되었고, 이러한 특성들은 텍스트 분류 및 저자 식별 작업에서 75–97%의 정확도를 달성했다.
The Gutenberg Literary English Corpus (GLEC, Jacobs, 2018a) provides a rich source of textual data for research in digital humanities, computational linguistics or neurocognitive poetics. In this study we address differences among the different literature categories in GLEC, as well as differences between authors. We report the results of three studies providing i) topic and sentiment analyses for six text categories of GLEC (i.e., children and youth, essays, novels, plays, poems, stories) and its >100 authors, ii) novel measures of semantic complexity as indices of the literariness, creativity and book beauty of the works in GLEC (e.g., Jane Austen's six novels), and iii) two experiments on text classification and authorship recognition using novel features of semantic complexity. The data on two novel measures estimating a text's literariness, intratextual variance and stepwise distance (van Cranenburgh et al., 2019) revealed that plays are the most literary texts in GLEC, followed by poems and novels. Computation of a novel index of text creativity (Gray et al., 2016) revealed poems and plays as the most creative categories with the most creative authors all being poets (Milton, Pope, Keats, Byron, or Wordsworth). We also computed a novel index of perceived beauty of verbal art (Kintsch, 2012) for the works in GLEC and predict that Emma is the theoretically most beautiful of Austen's novels. Finally, we demonstrate that these novel measures of semantic complexity are important features for text classification and authorship recognition with overall predictive accuracies in the range of .75 to .97. Our data pave the way for future computational and empirical studies of literature or experiments in reading psychology and offer multiple baselines and benchmarks for analysing and validating other book corpora.
연구 동기 및 목표
- 대규모 영문학 코퍼스 내에서 주요 문학 장르 간 주제, 감성, 스타일적 특징의 차이를 조사하기 위해.
- 문학 텍스트의 문학성, 창의성, 인식된 아름다움을 측정하기 위한 새로운 계산적 지표를 개발하고 검증하기 위해.
- 의미 복잡성 특징이 텍스트 분류 및 저자 식별 작업에 얼마나 유용한지 평가하기 위해.
- 미래의 디지털 인문학, 신경인지 문학, 계산 언어학 연구를 위한 실증적 기준과 기초 자료를 제공하기 위해.
제안 방법
- 6개의 문학 장르인 어린이 및 청소년 작품, 에세이, 소설, 연극, 시, 이야기에 대해 주제 및 감성 분석을 수행하였다.
- 문학성 평가를 위해 내문장 변동성과 단계적 거리라는 새로운 의미 복잡성 지표를 계산하였다.
- Gray 등(2016)의 지표를 기반으로 한 창의성 지수를 적용하여 저자 및 장르 간 언어의 독창성을 평가하였다.
- Kintsch(2012)의 지표를 바탕으로 한 인식된 아름다움 지수를 사용하여 문학 작품의 언어적 기교를 추정하였다.
- 의미 복잡성 특징을 활용해 텍스트 분류 및 저자 식별 모델을 훈련하고, 정확도 지표를 통해 성능을 평가하였다.
- 모든 분석은 100명 이상의 저자와 다양한 문학 형식을 포함하는 구텐베르크 문학 영어 코퍼스(GLEC)에서 수행되었다.
실험 결과
연구 질문
- RQ1GLEC 내에서 다양한 장르(예: 연극, 시, 소설)는 주제 분포와 감성 프로파일에서 어떻게 다를까?
- RQ2내문장 변동성과 단계적 거리가 텍스트의 문학성에 신뢰할 수 있는 지표로 기능할 수 있는가?
- RQ3Gray 등(2016)의 지표에 따르면 어느 장르와 저자가 가장 높은 수준의 언어적 창의성을 보였는가?
- RQ4의미 복잡성 특징이 텍스트 분류 및 저자 식별 모델의 정확도를 유의미하게 향상시킬 수 있는가?
- RQ5Kintsch(2012)의 인식된 아름다움 지표에 따르면 제인 오스틴의 소설 중 어느 작품이 가장 아름답다고 예측되는가?
주요 결과
- 내문장 변동성과 단계적 거리 지표에 기반해 연극이 가장 문학적인 장르로 특정되었으며, 그 다음으로 시와 소설이 뒤를 이었다.
- 시와 연극이 창의성에서 가장 높은 점수를 기록했으며, 가장 창의적인 개인 저자들은 밀턴, 폴, 키이츠, 바이런, 워즈워스와 같은 시인들로 나타났다.
- Kintsch(2012)의 인식된 아름다움 지표를 사용해 소설 *Emma*가 제인 오스틴의 작품 중 이론적으로 가장 아름다운 것으로 예측되었다.
- 의미 복잡성 특징은 텍스트 분류 및 저자 식별 작업에서 75%에서 97%의 예측 정확도를 달성했다.
- 이 연구는 문학 텍스트의 문학성, 창의성, 아름다움에 대한 검증된 계산 기반 기준을 제공하며, 향후 디지털 인문학 및 인지 과학 연구의 기초를 마련했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.