Skip to main content
QUICK REVIEW

[论文解读] Deep Convolutional Networks as Models of Generalization and Blending Within Visual Creativity

Graeme McCaig, Steve DiPaola|arXiv (Cornell University)|Oct 8, 2016
Aesthetic Perception and Analysis参考文献 33被引用 19
一句话总结

本文分析了两种基于深度学习的图像生成算法——Gatys 等人(2015)与 Mordvintsev 等人(2015)——它们利用深度卷积神经网络融合内容与风格特征。该研究将这些模型定位为人类创造性过程(尤其是概念融合与精炼)的计算类比,展示了其通过特征层面的泛化与融合生成新颖且具有美感图像的能力。

ABSTRACT

We examine two recent artificial intelligence (AI) based deep learning algorithms for visual blending in convolutional neural networks (Mordvintsev et al. 2015, Gatys et al. 2015). To investigate the potential value of these algorithms as tools for computational creativity research, we explain and schematize the essential aspects of the algorithms' operation and give visual examples of their output. We discuss the relationship of the two algorithms to human cognitive science theories of creativity such as conceptual blending theory and honing theory, and characterize the algorithms with respect to generation of novelty and aesthetic quality.

研究动机与目标

  • 探究深度卷积神经网络(DCNNs)是否能够模拟人类在视觉创造力中的类比泛化与融合过程。
  • 评估基于 DCNN 的图像生成算法在计算创造力研究中的潜力。
  • 根据创造力的认知理论,评估这些算法生成输出的新颖性与美学质量。
  • 探索算法行为与人类认知中概念融合理论及精炼理论的一致性。

提出的方法

  • 本文分析了两种具有代表性的基于 DCNN 的图像生成方法的架构与优化过程:Gatys 等人(2015)的神经风格迁移,以及 Mordvintsev 等人(2015)的神经图像合成。
  • 研究探讨了两种算法如何利用预训练卷积网络(如 VGG)的特征表示,分离并重新组合内容与风格信息。
  • 该方法涉及通过最小化损失函数来优化生成图像,该损失函数结合了内容损失(来自特定层的激活)与风格损失(特征图的格拉姆矩阵)。
  • 作者使用视觉示例与示意图说明算法的内部运作,强调特征层面的融合与泛化。
  • 将算法行为与认知科学中的理论框架进行比较,特别是概念融合与精炼理论。
  • 分析聚焦于模型的涌现特性,例如新颖组合的生成与美学一致性,而无需在创造性任务上进行显式训练。

实验结果

研究问题

  • RQ1深度卷积网络在多大程度上能够模拟人类视觉创造力中观察到的泛化与融合过程?
  • RQ2神经风格迁移与神经图像合成的架构与优化机制在多大程度上与认知科学中的概念融合理论相一致?
  • RQ3生成图像的美学质量与 DCNN 中底层特征表示之间存在何种关系?
  • RQ4这些模型生成新颖图像构图的行为能否被解释为一种计算创造力的形式?
  • RQ5这些算法如何通过特征层面的优化实现内容保留与风格迁移的双重目标?

主要发现

  • 两种算法——Gatys 等人(2015)与 Mordvintsev 等人(2015)——通过深度特征优化融合内容与风格,生成新颖且视觉连贯的图像。
  • 这些模型展现出泛化能力,其输出并非训练数据的直接复制,而是结构与风格元素的全新组合。
  • 生成的图像具有美学质量,表现出感知连贯性与视觉丰富性,表明深度特征空间支持有意义的创造性合成。
  • 两种模型的优化过程与认知过程中的“精炼”一致——即通过反馈迭代优化表示,以逼近期望结果。
  • 这些模型的行为映射了概念融合的关键特征,即将来自不同表征(内容与风格)的元素融合为一个全新的整体。
  • 本研究确立了,尽管 DCNNs 的训练目标是识别任务,但它们仍可作为人类视觉领域类比性创造性融合与泛化的有效计算模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。