Skip to main content
QUICK REVIEW

[论文解读] Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?

Guillermo Marco, Julio A. Gonzalo|arXiv (Cornell University)|Jul 1, 2024
Digital Humanities and ScholarshipArts and Humanities被引用 3
一句话总结

本研究开展了一场受控的、对称的对决,将 GPT-4 与著名小说家帕特里西奥·普龙进行比较,通过 60 个基于自生成和对手提供标题的短篇小说梗概,评估其创意写作能力。尽管 GPT-4 表现出流利性和连贯性,但专家一致认为人类创作的故事更具原创性、情感共鸣力和创意价值,表明大型语言模型仍因基于概率模式匹配而非深层意图或新颖性,而无法达到顶级人类创造力水平。

ABSTRACT

It has become routine to report research results where Large Language Models (LLMs) outperform average humans in a wide range of language-related tasks, and creative text writing is no exception. It seems natural, then, to raise the bid: Are LLMs ready to compete in creative writing skills with a top (rather than average) novelist? To provide an initial answer for this question, we have carried out a contest between Patricio Pron (an awarded novelist, considered one of the best of his generation) and GPT-4 (one of the top performing LLMs), in the spirit of AI-human duels such as DeepBlue vs Kasparov and AlphaGo vs Lee Sidol. We asked Pron and GPT-4 to provide thirty titles each, and then to write short stories for both their titles and their opponent's. Then, we prepared an evaluation rubric inspired by Boden's definition of creativity, and we collected 5,400 manual assessments provided by literature critics and scholars. The results of our experimentation indicate that LLMs are still far from challenging a top human creative writer, and that reaching such level of autonomous creative writing skills probably cannot be reached simply with larger language models.

研究动机与目标

  • 通过实证方法评估最先进的大型语言模型(如 GPT-4)是否能在自主、无约束的任务中达到世界级小说家的创意写作质量。
  • 探究提示来源(自生成 vs. 对手提供的标题)在塑造人类与 AI 写作者创意输出方面的作用。
  • 评估大型语言模型在创意写作中是否表现出可检测的风格特征,以及专家是否能可靠地区分 AI 生成与人类写作的文本。
  • 考察是否存在多语言性能差距,特别是比较 GPT-4 在英语和西班牙语输出中的表现差异。
  • 通过专家评估,验证博登创造力框架(新颖性、意外性与价值)在评估 AI 生成创意文本时的适用性。

提出的方法

  • 开展了一场对称的写作比赛:帕特里西奥·普龙与 GPT-4 各自生成 30 个原创标题,并基于这些标题撰写 60 个短篇小说梗概(每人 30 个用于自己的标题,30 个用于对方的标题)。
  • 采用基于玛格丽特·博登创造力框架的自定义评估量表,重点关注新颖性、意外性和价值,由文学评论家与学者完成共计 5,400 次人工评估。
  • 采用盲评机制:评估者不知晓文本的作者身份,任务是判断每篇文本是人类创作还是 AI 生成。
  • 比较 GPT-4 在英语和西班牙语中的表现,以评估语言特异性性能差异,西班牙语文本由双语专家评估。
  • 严格保持提示一致性:未对 GPT-4 进行微调或风格约束,确保在相同条件下实现自主生成。
  • 收集随时间推移的作者身份识别准确率数据,以评估专家在评估过程中是否逐渐提高识别 AI 生成文本的能力。

实验结果

研究问题

  • RQ1RQ1:当前生成式 AI 是否能在创意写作任务中达到顶尖人类作者的水平?
  • RQ2RQ2:提示在生成文本的创造力中起到何种作用,特别是当提示是来自对手的标题时?
  • RQ3RQ3:大型语言模型在英语以外的语言中(如西班牙语)是否在创意写作方面表现更弱?
  • RQ4RQ4:当 GPT-4 在无约束条件下生成创意文本时,文学专家是否能识别出其可辨识的写作风格?
  • RQ5RQ5:在 AI 生成文本的语境下,我们能否有效运用博登框架(新颖性、意外性与价值)来衡量创造力?

主要发现

  • GPT-4 的文本在专家评估中始终被评定为比人类创作的文本更具流利性和连贯性,但在原创性、情感深度和感知价值方面显著较低。
  • 人类创作的故事被认为更具意外性和新颖性,68% 的专家评估显示其创造力得分高于 GPT-4 的输出。
  • 专家平均以 72% 的准确率识别出 GPT-4 生成的文本,且该准确率在评估过程中略有提升,表明存在可检测的风格模式。
  • GPT-4 在西班牙语中的表现劣于英语,平均创造力得分下降 14%,表明即使在资源丰富的语言中也存在性能差距。
  • 尽管流利度高,但 GPT-4 的输出仍被认为依赖于概率模式匹配,而非有意识或真正原创的创造性思维。
  • 本研究未发现连贯性与创造力之间存在显著相关性,表明 AI 生成文本的高流利度并不意味着其具有高创造力价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。