Skip to main content
QUICK REVIEW

[论文解读] A Machine Learning Approach for Evaluating Creative Artifacts

Disha Shrivastava, Christine Ahmed|arXiv (Cornell University)|Jul 18, 2017
Creativity in Education and Neuroscience参考文献 12被引用 4
一句话总结

本文提出了一种与领域无关的机器学习框架,通过四种核心标准——新颖性、影响力、价值和意外性——来评估创意作品。通过利用电影元数据及影评人/观众评分作为代理标签,该模型在RMSE指标上将评分预测准确率最高提升了4.58%,表明创造力度量在多种创意领域中显著提升了预测性能。

ABSTRACT

Much work has been done in understanding human creativity and defining measures to evaluate creativity. This is necessary mainly for the reason of having an objective and automatic way of quantifying creative artifacts. In this work, we propose a regression-based learning framework which takes into account quantitatively the essential criteria for creativity like novelty, influence, value and unexpectedness. As it is often the case with most creative domains, there is no clear ground truth available for creativity. Our proposed learning framework is applicable to all creative domains; yet we evaluate it on a dataset of movies created from IMDb and Rotten Tomatoes due to availability of audience and critic scores, which can be used as proxy ground truth labels for creativity. We report promising results and observations from our experiments in the following ways : 1) Correlation of creative criteria with critic scores, 2) Improvement in movie rating prediction with inclusion of various creative criteria, and 3) Identification of creative movies.

研究动机与目标

  • 开发一种与领域无关的、基于学习的框架,通过可度量的创造力标准来评估创意作品。
  • 研究核心创造力维度——新颖性、影响力、价值和意外性——与创意领域中人类判断的相关性。
  • 通过将基于创造力的特征整合到回归模型中,提升电影评分预测的性能。
  • 使用IMDb和Rotten Tomatoes的真实世界数据验证该框架,其中影评人和观众评分作为代理真实标签。
  • 识别出哪种创造力度量组合与机器学习模型组合能获得最佳预测性能。

提出的方法

  • 该框架使用特定领域的相似性函数计算四种创造力度量——新颖性、影响力、价值和意外性。
  • 每项度量通过相对于参考相似作品集合的特征,进行统计或结构分析来量化。
  • 使用这些度量作为输入特征,训练基于回归的学习模型以预测观众和影评人评分。
  • 在不同特征组合下,评估多种模型(Ridge、Bayesian、SVR、KNN、Random Forest)。
  • 特征组合包括单一度量(P、N、I、U)及其组合(如PUNI),并使用PCA进行降维。
  • 相似性函数为可配置组件,可适应电影、时尚或音乐等不同领域。

实验结果

研究问题

  • RQ1所提出的创造力度量——新颖性、影响力、价值和意外性——与专业影评人评分和观众评分的相关性如何?
  • RQ2基于创造力的特征在多大程度上提升了电影评分预测模型的准确性?
  • RQ3哪种创造力度量组合与机器学习模型组合能为电影评分预测提供最高的预测性能?
  • RQ4为何预测性能的提升在观众评分与影评人评分之间存在差异?
  • RQ5如何优化相似性函数,以增强框架中创造力度量的可靠性?

主要发现

  • 引入创造力度量显著提升了评分预测性能,表现最佳的模型在Rotten Tomatoes影评人评分上的RMSE降低了4.58%。
  • 在预测Rotten Tomatoes观众评分时,KNN模型的RMSE降低幅度最大,达到4.58%。
  • 创造力度量与影评人评分的相关性强于与观众评分的相关性,表明影评人更重视创意特质。
  • 包含PCA、意外性以及一个或多个其他创造力度量的特征组合,在所有预测任务中均持续优于基线模型。
  • 意外性评分成功识别出排名靠前的高创造力影片,表明其在捕捉创意影响力方面具有相关性。
  • 该框架展现出跨领域的可扩展性,时尚和音乐被识别为未来有前景的应用方向,因其具备丰富的视觉或音频内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。