[论文解读] Experimental Narratives: A Comparison of Human Crowdsourced Storytelling and AI Storytelling
本文提出了一套行为与计算框架,使用相同的虚构提示,对比250名众包人类写作者与GPT-3.5及GPT-4生成的80篇叙事,发现尽管AI叙事在性别与性取向表现上更具进步性,但在想象力修辞与情节复杂性方面仍逊于人类创作的叙事,尽管其在清晰度与连贯性方面表现相当。
The paper proposes a framework that combines behavioral and computational experiments employing fictional prompts as a novel tool for investigating cultural artifacts and social biases in storytelling both by humans and generative AI. The study analyzes 250 stories authored by crowdworkers in June 2019 and 80 stories generated by GPT-3.5 and GPT-4 in March 2023 by merging methods from narratology and inferential statistics. Both crowdworkers and large language models responded to identical prompts about creating and falling in love with an artificial human. The proposed experimental paradigm allows a direct and controlled comparison between human and LLM-generated storytelling. Responses to the Pygmalionesque prompts confirm the pervasive presence of the Pygmalion myth in the collective imaginary of both humans and large language models. All solicited narratives present a scientific or technological pursuit. The analysis reveals that narratives from GPT-3.5 and particularly GPT-4 are more progressive in terms of gender roles and sexuality than those written by humans. While AI narratives with default settings and no additional prompting can occasionally provide innovative plot twists, they offer less imaginative scenarios and rhetoric than human-authored texts. The proposed framework argues that fiction can be used as a window into human and AI-based collective imaginary and social dimensions.
研究动机与目标
- 开发一种新颖的实验框架,用于研究人类与AI生成叙事中的文化想象与社会偏见,采用虚构提示作为工具。
- 探究以人类创造人工人类为核心的普西马利翁神话如何影响人类与大语言模型生成叙事的内容结构。
- 评估人类与AI生成叙事中隐含的社会偏见,特别是关于性别与种族的偏见。
- 评估大型语言模型(GPT-3.5与GPT-4)相较于人类写作者在叙事创新、修辞风格与情节复杂性方面的创造潜力。
- 确立虚构提示作为实证性、比较性研究在人工人文学科中的工具,对AI设计与人机交互具有启示意义。
提出的方法
- 通过在250名亚马逊Mechanical Turk众包工作者与GPT-3.5及GPT-4生成的80篇叙事中应用相同的虚构提示(关于创造并爱上一个人工人类),开展受控实验。
- 采用混合方法,结合叙事学分析(情节、话语、场景)与推断性统计分析,比较不同语料库中的叙事特征。
- 运用定量分析测量性别、种族与性取向的呈现情况,重点关注角色分配与关系动态。
- 使用定性比较分析评估修辞风格、想象广度与叙事创新性,包括情节转折与描述性语言。
- 将虚构叙事视为反映集体想象的文化产物,实现对人类与大语言模型生成内容的交叉分析。
- 利用普西马利翁神话作为文化透镜,研究叙事母题的持续性及其在人类与AI叙事中的演变。

实验结果
研究问题
- RQ1人类与大语言模型生成的叙事在多大程度上反映了普西马利翁神话的叙事结构与主题内容?
- RQ2在普西马利翁母题的语境下,人类写作与AI生成的叙事在性别角色与性取向表现上存在哪些差异?
- RQ3GPT-3.5与GPT-4生成的叙事在叙事想象力、修辞风格与情节创新方面,与人类创作的叙事有何不同?
- RQ4大语言模型生成的叙事在多大程度上反映或放大了与种族和性别相关的社会偏见,特别是在角色塑造与角色分配方面?
- RQ5虚构提示能否作为研究人类与人工智能叙事中文化想象与社会偏见的可靠且可扩展的工具?
主要发现
- 全部330篇叙事——无论人类还是AI生成——均围绕人工人类的科技或科学创造展开,证实普西马利翁神话在当代文化想象中具有普遍性。
- GPT-4在性别角色与同性关系表现上展现出更进步的倾向,GPT-3.5则程度稍低,尤其体现在为女性角色分配非刻板角色方面。
- 尽管在表现上更具进步性,AI叙事在场景设定、情节构思与修辞风格方面始终缺乏人类叙事的想象力,后者展现出更丰富、更富趣味性的语言。
- AI生成的叙事常采用简单化、说教式的结局与陈词滥调的语言,如“扮演上帝”或“幸福的幻觉”,表明其叙事能力范围较窄。
- 尽管AI叙事在清晰度与可理解性方面与人类叙事相当或略优,但缺乏人类叙事中体现的叙事多样性与创造性冒险精神。
- 本研究发现,AI生成的叙事虽在代际间保持风格一致且可识别,但在叙事泛化能力上仅达到平均水平人类写作者的水平,缺乏独特的叙事创新。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。