[论文解读] Results of a Single Blind Literary Taste Test with Short Anonymized Novel Fragments
本研究对8段匿名的250字荷兰语小说节选进行了单盲文学品味测试,48名参与者在7分制的文学质量量表上进行评分,发现人类评分与Riddle调查评分及机器学习预测结果之间存在中等到强相关性。结果表明,文本特征显著影响文学判断,尽管人类共识弱于模型表现,且显著的语言特征(如风格转变)在不同读者中的感知存在差异。
It is an open question to what extent perceptions of literary quality are derived from text-intrinsic versus social factors. While supervised models can predict literary quality ratings from textual factors quite successfully, as shown in the Riddle of Literary Quality project (Koolen et al., 2020), this does not prove that social factors are not important, nor can we assume that readers make judgments on literary quality in the same way and based on the same information as machine learning models. We report the results of a pilot study to gauge the effect of textual features on literary ratings of Dutch-language novels by participants in a controlled experiment with 48 participants. In an exploratory analysis, we compare the ratings to those from the large reader survey of the Riddle in which social factors were not excluded, and to machine learning predictions of those literary ratings. We find moderate to strong correlations of questionnaire ratings with the survey ratings, but the predictions are closer to the survey ratings. Code and data: https://github.com/andreasvc/litquest
研究动机与目标
- 探究人类对文学质量的判断是否主要基于文本特征,而非作者声望或标题等社会因素。
- 将匿名节选的人类评分与大规模调查评分及机器学习预测的文学质量进行比较。
- 通过参与者解释和短语引用,识别影响人类对文学质量感知的语言特征。
- 评估'文学性'作为可测量属性在不同评估方法中的构念效度。
- 探究前景化效应(如风格转变或文化引用)是否导致一致判断或分歧解读。
提出的方法
- 从Riddle文学质量调查中选取8段荷兰语小说节选(4段高度文学性,4段中等水平),每段250字,均来自章节开头。
- 通过将角色姓名替换为首字母并移除所有元数据(作者、标题、体裁)对节选进行匿名化处理,以消除社会影响。
- 向48名参与者发放7分制李克特量表问卷,要求提供文学质量评分、解释理由及引用的短语。
- 将参与者评分与Riddle调查评分(n=14k)及van Cranenburgh & Bod(2017)的机器学习预测结果进行比较,后者可解释61%的文学评分方差。
- 对参与者解释进行定性分析,以识别显著的语言特征及解释上的分歧。
- 使用相关性分析比较人类评分与调查及模型预测结果,评估构念效度。
实验结果
研究问题
- RQ1在匿名节选的判断中,人类读者在文学质量上的共识程度如何?该共识与大规模调查评分相比如何?
- RQ2人类对匿名节选的评分与仅基于文本特征训练的机器学习预测结果相比如何?
- RQ3哪些语言特征(如风格转变或文化引用)最显著地影响人类对文学质量的感知?
- RQ4参与者是否一致地将前景化短语(如突兀的隐喻或现代俚语)视为提升或降低文学质量?
- RQ5当元数据被移除后,体裁和作者性别在多大程度上仍会影响人类判断?
主要发现
- 匿名节选的人类评分与Riddle调查评分存在中等到强相关性,支持文学质量作为稳定属性的构念效度。
- 机器学习预测结果比人类评分更接近Riddle调查评分,表明模型可能捕捉到人类共识之外的细微文本模式。
- 参与者频繁引用短语'Bite, swallow, gone'作为显著特征,但对其效果意见不一——部分认为其具有创新性(评分6),另一些则认为其突兀(评分1),凸显了阐释上的分歧。
- 对流行文化的引用(如足球运动员)常被视为降低文学质量,表明存在一种'低俗内容降低声望'的启发式判断。
- 尽管已匿名化,体裁和性别效应在人类评分中仍部分存在,表明文本线索在元数据之外仍具残留影响。
- 即使识别出显著特征,研究未发现对'文学性'语言的强共识,挑战了仅靠前景化即可解释文学性的观点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。