Skip to main content
QUICK REVIEW

[论文解读] Evaluating Creativity in Computational Co-Creative Systems

Pegah Karimi, Kazjon Grace|arXiv (Cornell University)|Jul 25, 2018
Artificial Intelligence in Games被引用 14
一句话总结

本文提出一个四问框架——评估者、评估对象、时机与方法——用于评估人机协同创作系统中的创造力,此类系统中人类与人工智能实时协作共创作品。核心贡献在于指出了当前系统中的关键缺陷:大多数系统仅评估用户体验,而未评估人工智能自身的创造性贡献,并呼吁整合自我评估与意图性,以推动实现真正意义上的协同创作、具备自我意识的人工智能代理。

ABSTRACT

This paper provides a framework for evaluating creativity in co-creative systems: those that involve computer programs collaborating with human users on creative tasks. We situate co-creative systems within a broader context of computational creativity and explain the unique qualities of these systems. We present four main questions that can guide evaluation in co-creative systems: Who is evaluating the creativity, what is being evaluated, when does evaluation occur and how the evaluation is performed. These questions provide a framework for comparing how existing co-creative systems evaluate creativity, and we apply them to examples of co-creative systems in art, humor, games and robotics. We conclude that existing co-creative systems tend to focus on evaluating the user experience. Adopting evaluation methods from autonomous creative systems may lead to co-creative systems that are self-aware and intentional.

研究动机与目标

  • 解决计算创造力研究中协同创作系统缺乏系统性评估方法的问题。
  • 厘清协同创作系统、自主创造性系统与创造力辅助工具之间的区别。
  • 识别当前评估实践中的不足,特别是对用户体验指标的过度依赖。
  • 倡导在人工智能代理中嵌入自我评估与自我意识,以实现有意识的、创造性的协作。
  • 提供一个结构化框架,用于比较和改进跨不同领域协同创作系统中的评估方法。

提出的方法

  • 提出四问框架:(1) 谁来评估创造力?(2) 评估什么?(3) 评估何时发生?(4) 如何进行评估?
  • 将该框架应用于分析艺术、幽默、游戏和机器人领域的真实协同创作系统,包括 SHIMON 和基于文本的协同创作工具。
  • 将评估类型分类为形成性或总结性,将方法分类为观察法、用户研究或可用性测试。
  • 与自主创造性系统及创造力辅助工具进行对比,凸显协同创作场景下独特的评估需求。
  • 强调可解释人工智能、透明度与可中断性对于支持协作创造力的重要性。
  • 建议整合衡量人工智能生成创造力的指标——超越用户满意度——如原创性、连贯性与人工智能贡献的意图性。

实验结果

研究问题

  • RQ1如何在不同领域中系统性地评估人机协同创作系统中的创造力?
  • RQ2协同创作系统、自主创造性系统与创造力辅助工具在评估方法上有哪些关键差异?
  • RQ3为何当前的协同创作系统主要关注用户体验,而非评估人工智能自身创造性的贡献?
  • RQ4协同创作系统如何通过嵌入的评估机制实现自我意识与有意识行为?
  • RQ5需要哪些评估方法与指标,才能评估人工智能在塑造创作过程中的作用,而不仅仅是最终成果?

主要发现

  • 现有协同创作系统主要评估用户体验与产品满意度,对人工智能自身创造性输出的关注甚少。
  • 在 SHIMON 等系统中,评估依赖于现场表演观察与观众反应,表明其采用的是总结性、观察性的方法。
  • SHIMON 机器人的即兴行为被感知为具有启发性且互动性强,人类与人工智能交替进行创造性贡献。
  • 尽管广受好评(例如视频播放量超过 40,000 次),但并无正式指标评估该机器人创造力或原创性,仅依赖于用户感知。
  • 协同创作系统通常通过增加人工智能的主动性行为来扩展创造力辅助工具,但缺乏评估人工智能创造性意图或质量的机制。
  • 本研究结论认为,未来的协同创作系统必须采用自我评估方法,以实现自我意识与有意识协作,超越被动的用户反馈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。