[论文解读] Artificial muses: Generative Artificial Intelligence Chatbots Have Risen to Human-Level Creativity
本研究通过替代用途测试(AUT)评估生成式人工智能聊天机器人(GAI)是否达到人类水平的创造力,将100名人类与六种GAI模型(包括GPT-4)在创意流畅性与原创性方面进行比较。结果表明,顶级GAI与人类在创造力方面无显著定性差异,9.4%的人类表现出高于GPT-4的原创性,表明尽管存在真实意图性方面的局限,GAI仍是强大的创意助手。
A widespread view is that Artificial Intelligence cannot be creative. We tested this assumption by comparing human-generated ideas with those generated by six Generative Artificial Intelligence (GAI) chatbots: $alpa.\!ai$, $Copy.\!ai$, ChatGPT (versions 3 and 4), $Studio.\!ai$, and YouChat. Humans and a specifically trained AI independently assessed the quality and quantity of ideas. We found no qualitative difference between AI and human-generated creativity, although there are differences in how ideas are generated. Interestingly, 9.4 percent of humans were more creative than the most creative GAI, GPT-4. Our findings suggest that GAIs are valuable assistants in the creative process. Continued research and development of GAI in creative tasks is crucial to fully understand this technology's potential benefits and drawbacks in shaping the future of creativity. Finally, we discuss the question of whether GAIs are capable of being truly creative.
研究动机与目标
- 测试一种广泛持有的观点,即人工智能无法具备创造力,通过将GAI生成的创意与人类生成的创意进行比较。
- 评估生成式AI聊天机器人是否能在日常创造性任务中生成与人类相当质量与原创性的创意。
- 研究GAI是否可作为创造性过程中的有效助手,特别是在创意生成方面。
- 考察GAI输出在社会语境下是否满足新颖性与实用性的标准。
提出的方法
- 向100名人类参与者实施替代用途测试(AUT),要求他们为五个常见物品(如轮胎、牙刷)提出多种原创用途。
- 收集六种GAI模型的回应:alpa.ai、Copy.ai、ChatGPT-3、ChatGPT-4、Studio.ai和YouChat。
- 由人类评分员与一个独立训练的AI模型共同评估所有回应的原创性与流畅性。
- 采用标准化的发散性思维评分方法,重点关注创意流畅性(创意数量)与原创性(相对于规范样本的独特性)。
- 使用组内相关系数(ICC)进行评分者间一致性检验,以确保人类与AI评估的一致性。
- 采用混合效应模型分析结果,以考虑不同物体与评分者之间的变异性,显著性水平设定为p < 0.05。
实验结果
研究问题
- RQ1生成式AI聊天机器人生成的创意在定性上是否与人类生成的创意同样具有创造力?
- RQ2在原创性与流畅性方面,最先进的GAI(GPT-4)与人类参与者是否存在可测量的差异?
- RQ3GAI能否被视为创造性过程中的可靠助手,特别是在创意生成方面?
- RQ4在原创性方面,人类参与者在多大程度上超越了最富创造力的GAI输出?
主要发现
- 最先进的GAI(GPT-4)与人类参与者在原创性或流畅性方面无显著定性差异。
- GPT-4生成的创意在原创性与数量上与人类生成的创意在统计上无法区分。
- 9.4%的人类参与者生成的创意原创性高于GPT-4最富创造力的输出,表明在少数情况下,人类创造力仍超过GAI。
- 研究发现,无论是人类还是AI评分员,均一致将GAI输出评为新颖且实用,支持其输出具有‘创造性’的感知。
- 结果表明,GAI(尤其是GPT-4)可在创意生成任务中作为有效助手,尤其在需要快速构思的场景中。
- 尽管表现优异,GAI输出仍依赖于提示质量,且缺乏人类创造力所具备的完整认知与情感语境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。