Skip to main content
QUICK REVIEW

[论文解读] Creatism: A deep-learning photographer capable of creating professional work

Hui Fang, Meng Zhang|arXiv (Cornell University)|Jul 11, 2017
Advanced Image and Video Retrieval Techniques参考文献 20被引用 13
一句话总结

Creatism 是一种深度学习系统,通过一种新型的无标签训练方法,学习构图、光线和色彩等多种独立的美学要素,从而生成专业级照片。该系统利用来自 Google 地图街景的模拟环境,应用如“戏剧性遮罩”等优化图像操作来增强照片,在一次类似图灵测试的盲评中,41.4% 的专业摄影师将生成的照片评为半专业至专业水平。

ABSTRACT

Machine-learning excels in many areas with well-defined goals. However, a clear goal is usually not available in art forms, such as photography. The success of a photograph is measured by its aesthetic value, a very subjective concept. This adds to the challenge for a machine learning approach. We introduce Creatism, a deep-learning system for artistic content creation. In our system, we break down aesthetics into multiple aspects, each can be learned individually from a shared dataset of professional examples. Each aspect corresponds to an image operation that can be optimized efficiently. A novel editing tool, dramatic mask, is introduced as one operation that improves dramatic lighting for a photo. Our training does not require a dataset with before/after image pairs, or any additional labels to indicate different aspects in aesthetics. Using our system, we mimic the workflow of a landscape photographer, from framing for the best composition to carrying out various post-processing operations. The environment for our virtual photographer is simulated by a collection of panorama images from Google Street View. We design a "Turing-test"-like experiment to objectively measure quality of its creations, where professional photographers rate a mixture of photographs from different sources blindly. Experiments show that a portion of our robot's creation can be confused with professional work.

研究动机与目标

  • 开发一种无需依赖成对的前后图像标签或显式美学标签的深度学习系统,以生成专业级照片。
  • 将美学质量分解为多个半正交的图像操作,每个操作独立优化特定视觉要素(如构图、光线、色彩)。
  • 通过类似图灵测试的实验对系统进行评估,使专业摄影师无法可靠区分机器人生成与人类创作的照片。
  • 引入一种新型图像操作“戏剧性遮罩”,通过无监督学习方法从无标签数据中学习,以增强照片的戏剧性光线效果。
  • 证明通过客观的盲评方式,机器生成的照片可达到半专业至专业级别的美学标准。

提出的方法

  • 使用大量无额外标签的专业级照片数据集,为不同美学要素(如构图、对比度、饱和度)分别训练深度神经网络。
  • 每个美学要素均关联一个可微分的图像操作(如裁剪、HDR调整、戏剧性遮罩),可独立且高效地进行优化。
  • 通过组合现有滤镜生成负样本,学习“戏剧性遮罩”操作,使模型无需成对数据即可学习如何增强高对比度、戏剧性的光线效果。
  • 虚拟摄影师代理使用基于 Google 地图街景全景图的模拟环境,按顺序选择构图并应用后期处理操作。
  • 系统使用预测的美学得分(Φ̄)对图像输出进行排序,得分越高表示预期的专业吸引力越强。
  • 采用盲评协议,专业摄影师在不知晓图像来源的情况下,对混合的机器人生成与人类创作图像按四个美学质量等级进行评分。

实验结果

研究问题

  • RQ1在盲评环境中,深度学习系统能否生成与专业作品难以区分的照片?
  • RQ2是否可能在不使用成对的前后图像标签或显式美学标注的情况下,学习多个独立的摄影美学要素?
  • RQ3能否从无标签数据中端到端学习一种新型图像操作(如“戏剧性遮罩”),以改善特定美学质量(如光线对比度)?
  • RQ4在受控的盲评环境中,机器学习系统在多大程度上可达到专业级美学质量?
  • RQ5预测的美学得分(Φ̄)与专业摄影师对图像质量的实际评分之间相关性如何?

主要发现

  • 在盲评中,预测得分 ≥2.9 的机器人生成照片中,约 41.4% 获得了至少半专业水平(≥3.0)的评分。
  • 在高分作品中(Φ̄ ≥2.9),13% 的作品获得了 3.5 或以上的评分,接近专业质量的上限。
  • 预测得分 Φ̄ 与专业评分之间表现出强烈相关性,Φ̄ 越高,平均专业评分也显著提高。
  • 即使 AVA 数据集中排名前 5% 的图像(被视为专业作品)也仅获得 45% 的评分在 3.5 或以上,表明算法性能存在现实上限。
  • 该系统成功从无标签数据中学习了“戏剧性遮罩”操作,无需成对训练样本即可提升照片的光线对比度。
  • 通过人工筛选去除了存在严重瑕疵(如模糊、错位)的结果,最终将最成功的输出整理为一个公开的展示网页。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。