Skip to main content
QUICK REVIEW

[论文解读] Interactive Deep Colorization With Simultaneous Global and Local Inputs

Yi Xiao, Peiyao Zhou|arXiv (Cornell University)|Jan 27, 2018
Generative Adversarial Networks and Image Synthesis参考文献 4被引用 7
一句话总结

该论文提出了一种新颖的深度着色方法,可在单一U-Net架构中同时支持全局(色彩主题)和局部(色彩点)用户输入,通过专门设计的损失函数来区分输入影响。该方法通过实现灵活的用户控制(包括色彩主题推荐系统)取得了最先进性能,在同时使用全局和局部输入时,PSNR达到28.5375。

ABSTRACT

Colorization methods using deep neural networks have become a recent trend. However, most of them do not allow user inputs, or only allow limited user inputs (only global inputs or only local inputs), to control the output colorful images. The possible reason is that it's difficult to differentiate the influence of different kind of user inputs in network training. To solve this problem, we present a novel deep colorization method, which allows simultaneous global and local inputs to better control the output colorized images. The key step is to design an appropriate loss function that can differentiate the influence of input data, global inputs and local inputs. With this design, our method accepts no inputs, or global inputs, or local inputs, or both global and local inputs, which is not supported in previous deep colorization methods. In addition, we propose a global color theme recommendation system to help users determine global inputs. Experimental results shows that our methods can better control the colorized images and generate state-of-art results.

研究动机与目标

  • 解决现有深度着色方法无法同时处理全局和局部用户输入的局限性。
  • 通过引入作为全局输入的色彩主题,提升用户对着色输出的控制力,相较于直方图或样本图像,这种方式更具直观性。
  • 通过基于灰度纹理特征和学习到的色彩直方图映射的推荐系统,减少用户选择色彩主题的负担。
  • 设计一个统一的深度学习模型,支持四种输入组合:无输入、仅全局输入、仅局部输入,或同时使用全局和局部输入。

提出的方法

  • 该方法使用基于U-Net的神经网络,包含三个组件:特征提取(3个卷积层 + 3个池化层)、特征融合(整合全局色彩主题与提取的特征),以及重建(使用3个转置卷积层恢复Lab空间的色度通道)。
  • 设计了一种新颖的损失函数,以区分输入数据、全局输入(色彩主题)和局部输入(色彩点)的影响,确保在训练过程中各类输入贡献得当。
  • 全局输入被定义为包含3至7种颜色的色彩主题,相较于直方图或样本图像,更具用户友好性。
  • 通过在大型图像数据库上学习从灰度纹理特征到色彩直方图的映射,构建了全局色彩主题推荐系统,实现自动主题建议。
  • 该模型被训练以支持四种输入模式:无输入、仅全局输入、仅局部输入,或两者同时使用,所有模式均在单一网络中实现。
  • 通过在20张测试图像上使用PSNR评估网络性能,涵盖多种输入组合,并与最先进方法进行比较。

实验结果

研究问题

  • RQ1能否训练一个深度神经网络,使其能同时且有效地利用全局色彩主题和局部色彩点作为用户输入进行图像着色?
  • RQ2如何设计损失函数,以在端到端训练过程中区分并合理加权全局输入与局部输入的贡献?
  • RQ3与使用直方图或样本图像相比,使用色彩主题作为全局输入是否能提升用户控制力并减少输入负担?
  • RQ4基于纹理特征和学习到的色彩映射的推荐系统,能否有效建议与用户输入相关的色彩主题?
  • RQ5与专用模型相比,支持四种输入模式的统一模型在PSNR和视觉质量方面表现如何?

主要发现

  • 当同时使用全局和局部输入时,所提方法的PSNR达到28.5375,与所有评估方法中最高值极为接近。
  • 该方法优于基线自动着色方法(PSNR ≈ 24.5),且在仅使用全局输入时表现优于用户引导方法[17](27.8543 vs. 29.2105 PSNR)。
  • 在仅使用局部输入时,该方法的PSNR为27.2619,虽低于[17](29.0978),但仍表现强劲,表明在局部输入处理方面仍有优化空间。
  • 该方法具备实时推理能力,在GTX 1080Ti GPU上处理512×512图像仅需0.0228秒。
  • 该模型能成功对历史性和低质量黑白图像进行着色,仅需极少用户输入即可生成自然结果,尤其在结合推荐系统时效果更佳。
  • 该方法在多种图像类别中均能生成视觉自然且细节丰富的着色图像,包括户外场景、人物肖像和历史照片。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。