Skip to main content
QUICK REVIEW

[论文解读] Large Language Models show both individual and collective creativity comparable to humans

Luning Sun, Yuzhuo Yuan|arXiv (Cornell University)|Dec 4, 2024
Machine Learning in Materials ScienceMaterials Science被引用 3
一句话总结

本研究评估了大型语言模型(LLMs)在13项涵盖创意构思、问题解决和创意写作任务中的创造力表现,对比了其个体与集体表现与人类的差异。研究发现,顶级LLMs(Claude和GPT-4)在发散性思维和问题解决任务中达到人类水平的创造力,其集体输出相当于8–10名人类协作者的水平,表明LLMs在未来工作场景中可与小型人类团队相媲美。

ABSTRACT

Artificial intelligence has, so far, largely automated routine tasks, but what does it mean for the future of work if Large Language Models (LLMs) show creativity comparable to humans? To measure the creativity of LLMs holistically, the current study uses 13 creative tasks spanning three domains. We benchmark the LLMs against individual humans, and also take a novel approach by comparing them to the collective creativity of groups of humans. We find that the best LLMs (Claude and GPT-4) rank in the 52nd percentile against humans, and overall LLMs excel in divergent thinking and problem solving but lag in creative writing. When questioned 10 times, an LLM's collective creativity is equivalent to 8-10 humans. When more responses are requested, two additional responses of LLMs equal one extra human. Ultimately, LLMs, when optimally applied, may compete with a small group of humans in the future of work.

研究动机与目标

  • 评估大型语言模型(LLMs)在多样化领域中是否展现出与人类相当的创造力。
  • 不仅评估LLMs的个体表现,也评估其集体表现,以模拟团队协作的性能。
  • 在广泛的一组创意任务上,将LLMs与个体人类及人类群体进行基准对比。
  • 理解当多个响应被聚合时,LLM创造力的可扩展性。
  • 探讨LLMs对未来工作的影响,特别是在创意与协作角色方面的意义。

提出的方法

  • 本研究在三个领域(创意构思、问题解决、创意写作)中实施了13项创意任务。
  • LLMs以个体和集合形式进行评估——每项任务生成10个响应,以模拟集体输出。
  • 人类表现通过个体和群体响应进行衡量,群体规模为8–10名参与者。
  • 创造力通过各项任务的标准化指标进行评估,包括原创性、多样性与可行性。
  • 使用百分位数对表现进行统计基准比较,将LLM表现与个体人类及人类群体进行对比。
  • 本研究采用GPT-4和Claude作为领先的LLMs,对结果进行一致性与可扩展性分析。

实验结果

研究问题

  • RQ1LLMs是否能在多样化创意任务中达到与个体人类相当的创造力水平?
  • RQ2当LLMs生成多个响应时,其集体创造力与人类群体相比如何?
  • RQ3在哪些创意领域中,LLMs相较于人类表现更优或更差?
  • RQ4LLMs的聚合输出在多大程度上可替代人类团队协作在创意工作中的作用?
  • RQ5随着生成响应数量的增加,LLM创造力的可扩展性如何?

主要发现

  • 表现最佳的LLMs(Claude和GPT-4)在与个体人类对比中位于第52百分位,表明其创造力接近人类水平。
  • LLMs在发散性思维和问题解决任务中表现优异,生成的解决方案更具多样性和可行性。
  • LLMs在创意写作任务中表现欠佳,人类在原创性和叙事深度方面仍具优势。
  • 当对LLM进行10次查询时,其集体输出的创造力相当于8–10名人类协作者的水平。
  • 每增加两个额外的LLM响应,集体输出中相当于增加了一名额外的人类贡献者。
  • 当以最优方式应用时,LLMs在未来创意与协作性工作环境中可能与小型人类团队竞争。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。