[論文レビュー] Results of a Single Blind Literary Taste Test with Short Anonymized Novel Fragments
本研究では、48名の参加者が8つの匿名化された250語のオランダ語小説断片を7段階の文学的質の尺度で評価する単 blindedの文学的嗜好テストを実施した。その結果、人間の評価とRiddleの調査評価、および機械学習予測の間に中程度から強い相関が認められ、テクスト的特徴が文学的判断に顕著な影響を及ぼしていることが示唆された。ただし、人間の合意形成はモデルの性能を上回らない一方で、スタイリスティックなシフトのような顕著な言語的特徴は、読者間で異なるように認識される傾向がある。
It is an open question to what extent perceptions of literary quality are derived from text-intrinsic versus social factors. While supervised models can predict literary quality ratings from textual factors quite successfully, as shown in the Riddle of Literary Quality project (Koolen et al., 2020), this does not prove that social factors are not important, nor can we assume that readers make judgments on literary quality in the same way and based on the same information as machine learning models. We report the results of a pilot study to gauge the effect of textual features on literary ratings of Dutch-language novels by participants in a controlled experiment with 48 participants. In an exploratory analysis, we compare the ratings to those from the large reader survey of the Riddle in which social factors were not excluded, and to machine learning predictions of those literary ratings. We find moderate to strong correlations of questionnaire ratings with the survey ratings, but the predictions are closer to the survey ratings. Code and data: https://github.com/andreasvc/litquest
研究の動機と目的
- 人間の文学的質の判断が、著者名の権威や題名といった社会的要因よりも主にテクスト的特徴に基づいているかどうかを調査すること。
- 匿名化された断片の評価を、大規模な調査評価と機械学習による文学的質の予測と比較すること。
- 参加者による説明とフレーズの引用を通じて、文学的質の認識に影響を与える言語的特徴を同定すること。
- 「文学的質(literariness)」が、異なる評価手法において測定可能であるという構造的妥当性を評価すること。
- 目立つ表現効果(例:スタイルの変化や文化的参照)が、一貫した判断を生じさせるのか、あるいは解釈の相違を引き起こすのかを検討すること。
提案手法
- Riddleの文学的質の調査から、文学的質が高め(4つ)と中程度(4つ)のオランダ語小説断片を8つ選定。各断片は250語で、章の冒頭部分を対象とした。
- 登場人物の名前をイニシャルに置き換え、著者名、題名、ジャンルなどのすべてのメタデータを削除することで、断片を匿名化し、社会的要因の影響を排除した。
- 48名の参加者に7段階リッカート尺度のアンケートを実施。文学的質の評価、その理由の説明、および引用したフレーズを記入してもらった。
- 参加者の評価を、Riddle調査の評価(n=14,000)およびvan Cranenburgh & Bod(2017)の機械学習予測と比較。このモデルは文学的評価の分散の61%を説明している。
- 参加者の説明を定性的に分析し、顕著な言語的特徴と解釈の相違を同定した。
- 相関分析を用いて人間の評価と調査評価・モデル予測を比較し、構造的妥当性を評価した。
実験結果
リサーチクエスチョン
- RQ1匿名化された断片を評価する際、人間の読者が文学的質についてどの程度合意に達するか。また、その合意度は大規模調査の評価と比べてどうか。
- RQ2テクスト的特徴にのみ基づいて学習された機械学習予測と、人間の評価はどの程度一致するか。
- RQ3スタイリスティックなシフトや文化的参照といった言語的特徴の中で、人間の文学的質の認識に最も顕著な影響を与えるものは何か。
- RQ4参加者は、目立つ表現(例:不穏な隐喩や現代風スラング)を、文学的質の向上とみなすのか、それとも低下とみなすのか、一貫した解釈をしているか。
- RQ5メタデータを除去した状態でも、ジャンルや著者性別の影響が人間の判断に残っているか。
主な発見
- 匿名化された断片に対する人間の評価は、Riddle調査の評価と中程度から強い相関を示し、文学的質が安定した属性として構造的妥当性を有することを支持した。
- 機械学習による予測は、Riddle調査の評価にRiddle調査の評価に近いが、人間の評価よりもRiddle調査の評価に近かった。これは、モデルが人間の合意を超えて微細なテクスト的パターンを検出できることを示唆している。
- 参加者の多くが「Bite, swallow, gone」というフレーズを顕著な特徴として挙げたが、その効果については意見が分かれ、一部は革新的だと評価(6点)、他は不快に感じると評価(1点)した。これは解釈の相違を示している。
- ポップカルチャー(例:サッカー選手)への言及は、しばしば文学的質の低下要因として挙げられ、低俗な内容は権威を損なうというヒューリスティックが存在する可能性を示唆した。
- 匿名化にもかかわらず、ジャンルや性別の影響が人間の評価に部分的に残っており、メタデータを超えたテクスト的ヒントが残存している可能性を示した。
- 顕著な特徴が特定されても、「文学的言語」としての定義に強い合意が得られなかった。これは、目立つ表現が文学的質を説明するだけではないことを挑戦するものである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。