[论文解读] A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing
本研究在一项具有挑战性的开放式提示下,评估了12种近期指令微调的大语言模型与人类写作者在零样本创意写作中的表现:一场伊gnaTIus J. Reilly与翼龙之间的史诗级战斗。最先进商业大语言模型在流畅性、连贯性和风格方面与人类表现相当或略胜一筹,尽管人类在原创性和幽默感方面仍具优势,这揭示了模型在处理喜剧元素时存在二元分化。
We evaluate a range of recent LLMs on English creative writing, a challenging and complex task that requires imagination, coherence, and style. We use a difficult, open-ended scenario chosen to avoid training data reuse: an epic narration of a single combat between Ignatius J. Reilly, the protagonist of the Pulitzer Prize-winning novel A Confederacy of Dunces (1980), and a pterodactyl, a prehistoric flying reptile. We ask several LLMs and humans to write such a story and conduct a human evalution involving various criteria such as fluency, coherence, originality, humor, and style. Our results show that some state-of-the-art commercial LLMs match or slightly outperform our writers in most dimensions; whereas open-source LLMs lag behind. Humans retain an edge in creativity, while humor shows a binary divide between LLMs that can handle it comparably to humans and those that fail at it. We discuss the implications and limitations of our study and suggest directions for future research.
研究动机与目标
- 评估近期指令微调的大语言模型在零样本、开放式设置下的创意写作能力。
- 通过人类评估在多个维度上直接比较大语言模型与人类写作者的表现。
- 通过选择在训练数据中不太可能出现的独特、非冗余叙事场景,最小化数据泄露。
- 识别当前大语言模型在创意写作中的优势与局限,尤其在幽默感和原创性方面。
- 通过提供经人类评估的、全面的创意叙事评估,弥补大语言模型评估基准中的空白。
提出的方法
- 设计了一项新颖且原创的叙事提示:伊gnaTIus J. Reilly与一只翼龙之间的单人战斗,灵感源自普利策奖获奖小说和史前生物。
- 在相同零样本条件下,对12种近期指令微调的大语言模型和人类写作者进行提示生成,未进行微调或上下文学习。
- 采用改编自创意写作标准的评分表进行人类评估,评估维度包括流畅性、连贯性、原创性、幽默感和风格。
- 评分员在1–5分制下对每篇故事的十项标准进行打分,整体评分通过箱线图和统计摘要进行聚合与分析。
- 通过选择在大语言模型训练集中极不可能出现的场景,避免了训练数据的重复使用。
- 结果分析聚焦于模型表现与人类基准的对比,尤其关注幽默感和创造力方面的定性差异。

实验结果
研究问题
- RQ1与人类写作者相比,最先进指令微调的大语言模型在零样本创意写作中的表现如何?
- RQ2大语言模型在流畅性、连贯性、原创性、幽默感和风格等关键创意写作维度上,能在多大程度上与人类表现相当?
- RQ3与人类相比,当前大语言模型在生成幽默感和原创性叙事内容方面存在哪些局限?
- RQ4在零样本条件下,商业大语言模型是否优于开源模型在创意写作任务中的表现?
- RQ5当自动化指标不足时,人类评估在评估大语言模型生成的创意写作质量方面发挥何种作用?
主要发现
- 商业SOTA大语言模型在流畅性、连贯性和风格方面与人类写作者表现相当或略胜一筹,整体评分与人类表现紧密聚集。
- 人类在原创性方面仍具明显优势,大语言模型生成的故事表现出更多公式化或重复的叙事结构。
- 幽默感表现呈现二元分化:部分大语言模型能有效生成幽默,而另一些则完全失败,表明其喜剧推理能力不一致。
- 在所有评估维度上,开源大语言模型的表现均持续低于商业模型。
- 评分最低的故事由Alpaca生成,整体评分仅14/100,多项关键标准(如原创性和幽默感)得分仅为1或2。
- 尽管流畅性和连贯性表现良好,但许多大语言模型在复杂或荒诞情境下难以维持叙事张力和主题深度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。