[论文解读] Aesthetic-Driven Image Enhancement by Adversarial Learning
本文提出 EnhanceGAN,一种用于自动图像增强的弱监督生成对抗网络,仅使用二元美学质量标签(好/差)而非成对的输入-增强图像进行训练。通过训练生成器生成能欺骗判别器将其分类为高质量的增强图像,该模型端到端学习到有效的色彩增强和裁剪策略,在用户研究中达到与专业编辑相当的效果,并在基准数据集上表现出色。
We introduce EnhanceGAN, an adversarial learning based model that performs automatic image enhancement. Traditional image enhancement frameworks typically involve training models in a fully-supervised manner, which require expensive annotations in the form of aligned image pairs. In contrast to these approaches, our proposed EnhanceGAN only requires weak supervision (binary labels on image aesthetic quality) and is able to learn enhancement operators for the task of aesthetic-based image enhancement. In particular, we show the effectiveness of a piecewise color enhancement module trained with weak supervision, and extend the proposed EnhanceGAN framework to learning a deep filtering-based aesthetic enhancer. The full differentiability of our image enhancement operators enables the training of EnhanceGAN in an end-to-end manner. We further demonstrate the capability of EnhanceGAN in learning aesthetic-based image cropping without any groundtruth cropping pairs. Our weakly-supervised EnhanceGAN reports competitive quantitative results on aesthetic-based color enhancement as well as automatic image cropping, and a user study confirms that our image enhancement results are on par with or even preferred over professional enhancement.
研究动机与目标
- 开发一种无需昂贵成对训练数据(如输入图像与专业增强图像)的自动图像增强方法。
- 通过仅使用二元美学质量标签(好或差)作为监督信号,实现图像增强模型的端到端训练。
- 设计完全可微分的增强算子——分段色彩增强与深度滤波——以支持对抗训练。
- 将框架扩展至无需真实裁剪配对数据的自动图像裁剪。
- 通过定量指标与人类评估验证模型性能,证明其效果可媲美专业编辑。
提出的方法
- 采用生成对抗网络(GAN)框架,其中生成器学习增强低美学质量图像,判别器基于美学判断将图像分类为高质量或低质量。
- 生成器采用两个完全可微分的增强模块:分段色彩增强器与基于深度滤波的增强器,支持端到端反向传播。
- 模型采用弱监督训练:仅需提供图像是否具有美学质量的二元标签。
- 判别器在大规模美学数据集(如 Murray et al., 2012;Tang et al., 2013)上预训练,以区分高质量与低质量图像。
- 生成器通过优化,使生成的增强图像最大化判别器对“高质量”的置信度。
- 通过训练生成器预测最优裁剪区域,将框架扩展至自动图像裁剪,无需真实裁剪标注。
实验结果
研究问题
- RQ1能否仅使用二元美学标签而非成对的输入-增强图像来有效学习图像增强?
- RQ2基于弱监督的 GAN 框架能否产生与专业编辑相媲美的图像增强效果?
- RQ3完全可微分的增强算子(如分段色彩、深度滤波)能否在对抗训练设置中有效实现端到端学习?
- RQ4该框架能否扩展至无需真实裁剪配对数据的自动图像裁剪?
- RQ5弱监督的 EnhanceGAN 在定量指标与人类评估中的表现,与完全监督方法相比如何?
主要发现
- 在用户研究中,分段色彩增强器与基于深度滤波的增强器分别获得平均美学评分 5.189 和 5.289,超过 Photoshop-Auto 输出,并接近人类编辑的评分 5.232。
- 在用户研究中,EnhanceGAN 输出被评定为“最佳”或“优秀”的频率高于专业 Photoshop 输出,部分图像甚至优于人工编辑。
- 在 CUHK 图像裁剪数据集上,弱监督的 EnhanceGAN 在三位摄影师的平均重叠比达到 0.715(0.701,0.702),优于现有弱监督方法。
- 微调后,EnhanceGAN 达到最先进性能,重叠比达 0.828(0.805,0.798),接近完全监督基线。
- 模型在各类图像中表现出一致的增强效果:天空与海景图像被增强为互补色系,其他图像则显示出三色或分割互补色和谐特征。
- 视觉结果表明,EnhanceGAN 的增强效果在盲评中与人工编辑无法区分,测试集中无任何图像能被明确识别为模型生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。