Skip to main content
QUICK REVIEW

[论文解读] Pixel-level Semantics Guided Image Colorization

Jiaojiao Zhao, Li Liu|arXiv (Cornell University)|Aug 5, 2018
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出了一种基于分层深度神经网络的像素级语义引导图像着色方法,通过联合优化语义分割与着色损失,显著减少了上下文混淆和边缘着色渗色问题。通过引入细粒度的物体语义信息并采用联合双边上采样层,该模型生成的着色图像在真实感、细节表现和自然度方面均优于当前最先进方法。

ABSTRACT

While many image colorization algorithms have recently shown the capability of producing plausible color versions from gray-scale photographs, they still suffer from the problems of context confusion and edge color bleeding. To address context confusion, we propose to incorporate the pixel-level object semantics to guide the image colorization. The rationale is that human beings perceive and distinguish colors based on the object's semantic categories. We propose a hierarchical neural network with two branches. One branch learns what the object is while the other branch learns the object's colors. The network jointly optimizes a semantic segmentation loss and a colorization loss. To attack edge color bleeding we generate more continuous color maps with sharp edges by adopting a joint bilateral upsamping layer at inference. Our network is trained on PASCAL VOC2012 and COCO-stuff with semantic segmentation labels and it produces more realistic and finer results compared to the colorization state-of-the-art.

研究动机与目标

  • 通过利用像素级物体语义信息,解决自动图像着色中的上下文混淆问题,实现更准确的颜色分配。
  • 通过在深度学习着色过程中缓解因推理阶段尺度变化引起的边缘着色渗色问题。
  • 通过将语义分割中的平移不变表示整合到着色过程中,提升着色结果的真实感。
  • 通过联合优化分割与着色目标,在基准数据集上实现更优性能。
  • 与现有方法相比,生成更具自然感、更高饱和度且边缘保持更完整的着色图像。

提出的方法

  • 设计了一个双分支分层神经网络:一个分支执行像素级语义分割,另一个分支预测每个像素的颜色分布。
  • 网络通过两种损失函数进行联合训练:语义分割损失与着色损失,实现端到端优化。
  • 在推理阶段引入联合双边上采样层,以生成更平滑、更清晰的颜色图,同时保留边缘细节。
  • 模型在PASCAL VOC2012和COCO-Stuff数据集上进行预训练,利用密集的语义标注学习丰富的特定物体颜色先验。
  • 网络架构利用深层卷积特征与转置卷积层,以恢复高分辨率的着色输出。
  • 来自像素级标签的语义监督增强了模型对物体类别区分的能力,并实现语义上合理的颜色分配。

实验结果

研究问题

  • RQ1像素级语义理解能否减少图像着色中的上下文混淆?
  • RQ2在基于深度学习的着色中,如何最小化因输入尺度变化导致的边缘着色渗色?
  • RQ3联合优化语义分割与着色任务能否提升生成着色图像的真实感与细节表现?
  • RQ4与图像级或全局语义先验相比,引入细粒度语义先验在着色任务中能带来多大性能提升?
  • RQ5所提出的联合双边上采样层与标准转置卷积上采样相比,在保留颜色边界方面表现如何?

主要发现

  • 所提方法在PASCAL VOC2012与COCO-Stuff数据集的联合测试集上,自然度得分达到94.89%,显著优于当前最先进方法。
  • 饱和度得分为95.70%,表明生成的颜色比竞争方法更鲜艳、更具视觉吸引力。
  • 语义正确性达到94.10%,证明模型能为物体类别分配语义上合理且一致的颜色,有效减少语义混淆。
  • 边缘保持性能为94.80%,证实联合双边上采样层在保留锐利颜色过渡方面的有效性。
  • 人工评估显示,所提方法在真实感、颜色饱和度与结构保真度方面更接近真实图像。
  • 失败案例揭示了在稀有物体类别(如孔雀、珠宝)以及小物体混淆方面的局限性,提示需要更细粒度的语义分割类别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。