Skip to main content
QUICK REVIEW

[论文解读] Semantic White Balance: Semantic Color Constancy Using Convolutional Neural Network

Mahmoud Afifi|arXiv (Cornell University)|Feb 1, 2018
Color Science and Applications参考文献 10被引用 14
一句话总结

本文提出了一种基于语义的白平衡方法,利用卷积神经网络(CNNs)通过将语义分割掩码与RGB图像数据相结合,提升颜色恒常性。通过训练改进的AlexNet来同时利用空间和语义信息,估算光源颜色和伽马校正参数,该方法相比无语义基线模型将颜色校正误差降低了40%以上,表明语义上下文显著提升了光源估计的准确性。

ABSTRACT

The goal of computational color constancy is to preserve the perceptive colors of objects under different lighting conditions by removing the effect of color casts caused by the scene's illumination. With the rapid development of deep learning based techniques, significant progress has been made in image semantic segmentation. In this work, we exploit the semantic information together with the color and spatial information of the input image in order to remove color casts. We train a convolutional neural network (CNN) model that learns to estimate the illuminant color and gamma correction parameters based on the semantic information of the given image. Experimental results show that feeding the CNN with the semantic information leads to a significant improvement in the results by reducing the error by more than 40%.

研究动机与目标

  • 通过在深度学习模型中整合语义信息,提升计算颜色恒常性。
  • 解决传统颜色恒常性方法仅依赖颜色和空间统计的局限性。
  • 探究语义分割掩码是否能提升基于CNN的白平衡系统中的光源估计精度。
  • 评估该方法在语义掩码不完美或不准确情况下的鲁棒性。
  • 证明使用语义感知CNN联合学习光源颜色与伽马校正的有效性。

提出的方法

  • 该方法将输入图像表示为结合RGB通道与语义掩码的4D张量,使网络能够同时处理颜色与语义内容。
  • 采用改进的AlexNet架构,用4D卷积层替代第一层以处理4D输入张量。
  • 全连接层被重构为四个新层(fc6–fc9),随后接一个回归头,用于预测四个参数:红色、绿色和蓝色光源分量(r, g, b)以及伽马校正(γ)。
  • 图像校正通过以下公式完成:ŝ = (I × M)^(1/γ),其中M为光源分量倒数的对角矩阵。
  • 模型使用从ADE20K数据集中真实sRGB图像应用随机色偏(r, g, b ∈ [0.7, 1.3])和伽马校正(γ ∈ [0.85, 1.15])生成的合成数据进行训练。
  • 数据增强包括空间变换,以丰富训练数据并提升泛化能力。

实验结果

研究问题

  • RQ1将语义分割掩码集成到CNN中是否能提升颜色恒常性中光源估计的准确性?
  • RQ2与仅使用RGB和空间特征的模型相比,语义上下文的引入如何影响基于深度学习的白平衡模型性能?
  • RQ3当使用不准确或含噪声的语义掩码时,模型性能会下降到何种程度?
  • RQ4与单独或固定参数校正相比,联合估计光源颜色与伽马校正是否能带来更好的视觉与定量结果?
  • RQ5在受控色偏的合成数据上训练的CNN能否有效泛化到真实世界sRGB图像?

主要发现

  • 与无语义输入的基线CNN相比,所提方法在完整ADE20K测试集上将平均均方根误差(RMSE)降低了40%以上,RMSE从53.8815降至31.1355。
  • 当无需伽马校正时(γ = 1),误差降低更为显著,从51.8160降至20.1450,表明在干净情况下性能极强。
  • 定性结果表明,该方法在视觉校正效果上优于灰度世界法、Adobe Photoshop自动校正、Lightroom及标准AlexNet基线模型。
  • 即使输入为不准确的语义掩码,模型仍保持较强性能,如图6所示,错误掩码导致性能下降但结果仍优于无语义基线。
  • 如图4所示,该方法在NUS和Gehler数据集上均优于传统算法(如灰度世界法、白点法和基于PCA的光源估计法)。
  • 使用语义掩码使网络能够利用先验知识(例如天空应为蓝色),从而提升光源估计的鲁棒性与准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。