Skip to main content
QUICK REVIEW

[论文解读] Deep Structured-Output Regression Learning for Computational Color Constancy

Yanlin Qian, Ke Chen|arXiv (Cornell University)|Jul 13, 2016
Color Science and Applications参考文献 48被引用 9
一句话总结

本文提出了一种深度结构化输出回归框架,利用预训练VGG和AlexNet网络全连接层的特征来估计场景光照,以实现计算色彩恒常性。通过采用多输出支持向量回归(MSVR)来建模通道间的相关性,该方法在SFU Indoor基准上实现了最先进性能,中值角度误差为1.64°,优于先前方法,并证明了VGG优于AlexNet以及fc6层优于fc7/fc8层的优越性。

ABSTRACT

Computational color constancy that requires esti- mation of illuminant colors of images is a fundamental yet active problem in computer vision, which can be formulated into a regression problem. To learn a robust regressor for color constancy, obtaining meaningful imagery features and capturing latent correlations across output variables play a vital role. In this work, we introduce a novel deep structured-output regression learning framework to achieve both goals simultaneously. By borrowing the power of deep convolutional neural networks (CNN) originally designed for visual recognition, the proposed framework can automatically discover strong features for white balancing over different illumination conditions and learn a multi-output regressor beyond underlying relationships between features and targets to find the complex interdependence of dif- ferent dimensions of target variables. Experiments on two public benchmarks demonstrate that our method achieves competitive performance in comparison with the state-of-the-art approaches.

研究动机与目标

  • 通过从图像特征中估计场景光照来解决色彩恒常性问题的欠定性。
  • 通过建模通道间相关性来改进光照估计,而单输出方法无法捕捉这些相关性。
  • 评估深度卷积神经网络特征(特别是来自VGG和AlexNet的特征)在端到端色彩恒常性中的有效性。
  • 确定用于光照估计的最佳CNN层(fc6、fc7、fc8)和回归器(MSVR、MRR、RR)。
  • 比较端到端CNN回归与混合CNN+结构化回归框架的性能。

提出的方法

  • 该方法使用预训练VGG和AlexNet的全连接层激活值(fc6、fc7、fc8)作为深度视觉特征。
  • 通过多输出支持向量回归(MSVR)执行光照估计,该方法建模了红、绿、蓝通道预测之间的相关性。
  • 该框架将特征提取(通过CNN)与回归(通过MSVR)解耦,从而在高层表示上实现结构化输出学习。
  • 通过随机和规则的图像块采样进行数据增强,以增加训练多样性,但导致过拟合并降低性能。
  • 该方法在两个基准上进行评估:SFU Color Checker和SFU Indoor,以角度误差为主要指标。
  • 通过与单输出SVR、岭回归(RR)和多输出岭回归(MRR)的对比,评估结构化输出建模的优势。

实验结果

研究问题

  • RQ1与单输出回归相比,建模光照估计中的通道间相关性是否能提升性能?
  • RQ2哪种预训练CNN架构(VGG与AlexNet)能为光照估计提供更好的特征?
  • RQ3哪个全连接层(fc6、fc7、fc8)能为色彩恒常性提供最具判别力的特征?
  • RQ4混合CNN+结构化回归框架是否能优于端到端CNN回归?
  • RQ5通过图像块采样进行数据增强如何影响光照估计中的泛化能力和性能?

主要发现

  • VGG在两个基准上均优于AlexNet,在SFU Color Checker上的中值误差降低0.7–0.9,在SFU Indoor上降低0.35。
  • 最佳性能由fc6层实现,因为更深的层(fc7、fc8)因丢失低层次视觉线索而使性能下降。
  • 多输出SVR(MSVR)显著优于单输出SVR,证明了建模通道间相关性的重要性。
  • CNN+MSVR框架在SFU Indoor基准上实现了1.64°的中值角度误差,优于当前最先进方法。
  • 通过图像块采样进行数据增强导致过拟合并使性能劣于所提出的CNN+MSVR框架。
  • VGG特征与MSVR的结合取得了最佳结果,在SFU Color Checker上的均值误差为4.29,在SFU Indoor上为3.25。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。