Skip to main content
QUICK REVIEW

[论文解读] A Benchmark for Temporal Color Constancy

Yanlin Qian, Jani Käpylä|arXiv (Cornell University)|Mar 8, 2020
Color Science and Applications参考文献 34被引用 4
一句话总结

本文提出了TCC-benchmark,这是目前规模最大、基于真实场景的时序色彩恒常性数据集,包含600个高分辨率视频序列,并提出了TCC-Net,一种基于2D-LSTM的新型深度学习模型,通过利用多帧时序信息实现更优的光照估计。TCC-Net在TCC-benchmark上将平均角度误差降低了40%,在SFU Gray Ball数据集上降低了30%,达到当前最优性能。

ABSTRACT

Temporal Color Constancy (CC) is a recently proposed approach that challenges the conventional single-frame color constancy. The conventional approach is to use a single frame - shot frame - to estimate the scene illumination color. In temporal CC, multiple frames from the view finder sequence are used to estimate the color. However, there are no realistic large scale temporal color constancy datasets for method evaluation. In this work, a new temporal CC benchmark is introduced. The benchmark comprises of (1) 600 real-world sequences recorded with a high-resolution mobile phone camera, (2) a fixed train-test split which ensures consistent evaluation, and (3) a baseline method which achieves high accuracy in the new benchmark and the dataset used in previous works. Results for more than 20 well-known color constancy methods including the recent state-of-the-arts are reported in our experiments.

研究动机与目标

  • 为解决当前缺乏大规模、真实场景的时序色彩恒常性数据集以供基准测试的问题。
  • 在固定训练-测试划分下,评估超过20种单帧与时序色彩恒常性方法的性能。
  • 提出一种强大且高效的基线模型(TCC-Net),在新旧基准上均优于现有方法。
  • 通过开源数据集与代码,实现时序色彩恒常性方法的公平、可复现评估。
  • 探索架构设计选择,如2D-LSTM、SqueezeNet主干网络及可变长度输入序列,以实现最优性能。

提出的方法

  • TCC-benchmark由600个真实世界视频序列组成,使用高分辨率智能手机拍摄,涵盖不同室内与室外场景,光照与天气条件多样。
  • 采用固定训练-测试划分,确保所有方法评估的一致性,序列长度在3至17帧之间。
  • TCC-Net采用双分支架构:一个分支使用SqueezeNet处理当前帧以提取特征,另一分支使用2D-LSTM处理前序帧的伪序列,以建模时空依赖关系。
  • 2D-LSTM模块通过在2D特征图上应用卷积循环,同时捕捉空间与时间相关性,核大小K=5,隐藏维度H=128,实现最优权衡。
  • 模型端到端训练以预测光源色度,损失函数通过在真实标签上的平均角度误差最小化。
  • 框架支持可变长度输入序列,适用于实际取景器场景中序列长度未知的部署需求。

实验结果

研究问题

  • RQ1在真实、大规模基准下,时序色彩恒常性方法相较于单帧方法的性能表现如何?
  • RQ2哪些架构组件(如1D与2D-LSTM、主干网络、序列长度)在时序色彩恒常性中表现最佳?
  • RQ3轻量化、适合移动设备的模型能否在时序色彩恒常性任务中实现SOTA精度?
  • RQ4所提出的TCC-Net在不同数据集(包括先前使用的SFU Gray Ball数据集)上的泛化能力如何?
  • RQ5与单帧或1D-LSTM基线相比,2D-LSTM学习到的时空特征在光照估计中的提升程度如何?

主要发现

  • TCC-Net在TCC-benchmark上的平均角度误差为1.46°,相比最佳单帧方法降低40%,相比最佳先前时序方法降低27%。
  • TCC-Net的2D-LSTM变体(模型G)表现最佳,优于1D-LSTM及其他配置,平均角度误差为1.46°,内存占用68.8 MB。
  • 采用SqueezeNet作为主干网络可将内存占用降至6.6 MB(模型C),同时保持高精度,适合移动端部署。
  • 双分支架构结合伪序列分支相比单分支设计,平均误差降低12.7%。
  • 2D-LSTM的最优核大小为K=5,最佳隐藏维度为H=128,可在欠拟合与过拟合之间实现最佳平衡。
  • TCC-Net泛化能力强,在SFU Gray Ball数据集上,相比最佳单帧方法平均角度误差降低33%,相比最佳时序方法降低30%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。