[논문 리뷰] Results of a Single Blind Literary Taste Test with Short Anonymized Novel Fragments
이 연구는 48명의 참가자가 8개의 匿名화된 250단어 분량의 네덜란드어 소설 단락을 7점 척도로 문학적 품질에 대해 평가하는 단일맹각 문학적 미각 테스트를 실시하여, 인간 평가자와 Riddle 설문 평가 및 기계학습 예측 간 중간 정도에서 강한 상관관계를 발견하였다. 결과는 텍스트적 특징이 문학적 판단에 중대한 영향을 미친다는 것을 시사하지만, 인간의 합의는 모델 성능보다 약하며, 스타일 전환과 같은 두드러진 언어적 특징은 독자 간에 다르게 인식된다는 점을 보여준다.
It is an open question to what extent perceptions of literary quality are derived from text-intrinsic versus social factors. While supervised models can predict literary quality ratings from textual factors quite successfully, as shown in the Riddle of Literary Quality project (Koolen et al., 2020), this does not prove that social factors are not important, nor can we assume that readers make judgments on literary quality in the same way and based on the same information as machine learning models. We report the results of a pilot study to gauge the effect of textual features on literary ratings of Dutch-language novels by participants in a controlled experiment with 48 participants. In an exploratory analysis, we compare the ratings to those from the large reader survey of the Riddle in which social factors were not excluded, and to machine learning predictions of those literary ratings. We find moderate to strong correlations of questionnaire ratings with the survey ratings, but the predictions are closer to the survey ratings. Code and data: https://github.com/andreasvc/litquest
연구 동기 및 목표
- 인간의 문학적 품질 판단이 저자 명성이나 제목과 같은 사회적 요인보다 주로 텍스트적 특징에 기반하는지 여부를 조사하기 위해.
- 익명화된 단락에 대한 인간 평가를 대규모 설문 평가와 기계학습 예측의 문학적 품질과 비교하기 위해.
- 참가자 설명과 어휘 인용을 통해 인간이 문학적 품질을 어떻게 인식하는지 영향을 미치는 언어적 특징을 특정하기 위해.
- 다양한 평가 방법에서 '문학성(literariness)'이 측정 가능한 특성으로서의 구성 타당성을 평가하기 위해.
- 초점 효과(foregrounding effects)—예를 들어 스타일 전환이나 문화적 참조—가 일관된 판단을 이끌어내는지 아니면 다수의 해석을 유도하는지 탐색하기 위해.
제안 방법
- Riddle의 문학적 품질 설문에서 선정된 8개의 네덜란드어 소설 단락(문학적으로 높은 수준의 4개, 중간 수준의 4개)을 선택하였으며, 각 단락은 250단어 분량이며 장의 시작 부분에서 가져왔다.
- 참가자들의 사회적 영향을 제거하기 위해 인물 이름을 초기자로 대체하고 모든 메타데이터(저자, 제목, 장르)를 제거하여 단락을 익명화하였다.
- 48명의 참가자에게 7점 리커트 척도 설문지를 배포하여 문학적 품질 평가, 설명, 인용된 어휘를 요청하였다.
- 참가자 평가를 Riddle 설문 평가(n=14,000)와 van Cranenburgh & Bod(2017)의 기계학습 예측 결과와 비교하였으며, 이 모델은 문학적 평가의 변동성의 61%를 설명하였다.
- 참가자 설명의 정성적 분석을 통해 두드러진 언어적 특징과 해석의 불일치를 식별하였다.
- 상관계수 분석을 통해 인간 평가와 설문 및 모델 예측 간의 상관관계를 비교하고, 구성 타당성을 평가하였다.
실험 결과
연구 질문
- RQ1익명화된 단락을 평가할 때 인간 독자가 얼마나 문학적 품질에 대해 일치하는가? 이 일치 수준은 대규모 설문 평가와 비교해 어떻게 다를까?
- RQ2텍스트적 특징에만 기반한 기계학습 예측과 비교해, 익명화된 단락에 대한 인간 평가는 어떻게 다른가?
- RQ3스타일 전환이나 문화적 참조와 같은 언어적 특징 중에서 인간의 문학적 품질 인식에 가장 두드러진 영향을 미치는 것은 무엇인가?
- RQ4참가자들은 초점화된 어휘(예: 충격적인隐喩나 현대어 슬랭)를 문학적 품질 향상 또는 저하 요소로 일관되게 인식하는가?
- RQ5메타데이터가 제거된 상황에서 장르와 저자 성별은 인간의 판단에 어느 정도 영향을 미치는가?
주요 결과
- 익명화된 단락에 대한 인간 평가가 Riddle 설문 평가와 중간 정도에서 강한 상관관계를 보였으며, 이는 문학적 품질이 안정된 특성으로서의 구성 타당성을 지지한다.
- 기계학습 예측 결과는 인간 평가보다 Riddle 설문 평가와 더 가까운 상관관계를 보였으며, 이는 모델이 인간의 합의를 넘어서는 미세한 텍스트 패턴을 감지할 수 있음을 시사한다.
- 참가자들은 자주 'Bite, swallow, gone'이라는 어휘를 두드러진 특징으로 언급했지만, 그 효과에 대해 의견이 갈렸다—일부는 창의적이라고 평가(6점), 다른 일부는 충격적으로 느꼈다(1점)—이를 통해 해석의 분열이 드러났다.
- 대중문화 참조(예: 축구 선수)는 종종 문학적 품질을 떨어뜨리는 요소로 인식되었으며, 이는 저수준의 콘텐츠가 위상성을 떨어뜨린다는 히ュ리스틱을 시사한다.
- 익명화에도 불구하고 장르와 성별 효과가 인간 평가에 부분적으로 유지되어, 메타데이터를 초월한 텍스트적 단서의 잔여 영향이 있음을 시사한다.
- 심지어 두드러진 특징이 식별된 상황에서도 '문학적 언어'의 기준에 대해 강한 합의가 없었으며, 이는 초점화만으로는 문학성이 설명되지 않는다는 개념에 도전한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.