[论文解读] DDColor: Towards Photo-Realistic Image Colorization via Dual Decoders
DDColor 提出了一种使用双解码器的端到端图像着色方法:一个用于空间重建的像素解码器,以及一个基于查询的 Transformer 解码器,该解码器从多尺度特征中学习语义感知的着色查询,而无需手工设计的先验。这种设计显著减少了颜色渗色现象,并增强了颜色的丰富度,在 ImageNet、COCO-Stuff 和 ADE20k 上实现了最先进性能,且在定性和定量结果上均表现优异。
Image colorization is a challenging problem due to multi-modal uncertainty and high ill-posedness. Directly training a deep neural network usually leads to incorrect semantic colors and low color richness. While transformer-based methods can deliver better results, they often rely on manually designed priors, suffer from poor generalization ability, and introduce color bleeding effects. To address these issues, we propose DDColor, an end-to-end method with dual decoders for image colorization. Our approach includes a pixel decoder and a query-based color decoder. The former restores the spatial resolution of the image, while the latter utilizes rich visual features to refine color queries, thus avoiding hand-crafted priors. Our two decoders work together to establish correlations between color and multi-scale semantic representations via cross-attention, significantly alleviating the color bleeding effect. Additionally, a simple yet effective colorfulness loss is introduced to enhance the color richness. Extensive experiments demonstrate that DDColor achieves superior performance to existing state-of-the-art works both quantitatively and qualitatively. The codes and models are publicly available at https://github.com/piddnad/DDColor.
研究动机与目标
- 为解决图像着色任务的病态性质,特别是基于深度学习的方法中存在的多模态不确定性与语义不一致问题。
- 克服先前基于 Transformer 的方法依赖手工设计先验、泛化能力差或在复杂场景中出现颜色渗色的局限性。
- 在无需用户引导或外部先验的前提下,提升自动图像着色的颜色丰富度与语义一致性。
- 开发一种端到端框架,联合优化空间细节与语义感知的颜色表征。
提出的方法
- 该方法采用双解码器架构:像素解码器用于恢复高分辨率的空间特征,而基于查询的颜色解码器则通过交叉注意力机制,从多尺度视觉特征中学习颜色嵌入。
- 颜色解码器使用可学习查询来关注多尺度图像特征,从而在无需手工设计先验的前提下,实现语义感知的颜色表征学习。
- 交叉注意力机制在语义特征与颜色查询之间建立动态关联,减少颜色渗色并提升上下文感知的着色效果。
- 提出了一种新颖的颜色丰富度损失,以显式增强生成颜色输出的鲜艳度与丰富度。
- 最终的着色结果通过融合两个解码器的输出生成,最终图像由输入的 L 通道与预测的 AB 通道拼接而成。
- 模型通过感知损失与颜色丰富度损失进行端到端训练,消融实验验证了各组件的重要性。
实验结果
研究问题
- RQ1具有可学习颜色查询的双解码器架构是否能改善图像着色中的语义一致性并减少颜色渗色?
- RQ2在包含小物体或多样化物体的复杂场景中,颜色解码器中使用多尺度特征对性能有何影响?
- RQ3可学习的、端到端的颜色解码器在多大程度上可以替代图像着色中的手工设计先验?
- RQ4专用的颜色丰富度损失是否能显著提升生成着色结果的视觉丰富度?
- RQ5该方法在无需微调的情况下,对 ImageNet 之外的数据集(如 COCO-Stuff 和 ADE20k)的泛化能力如何?
主要发现
- DDColor 在 ImageNet 上实现了 3.92 的最佳 FID 分数,优于此前的最先进方法,包括使用分类式颜色空间离散化的模型。
- 使用 100 个颜色查询的模型达到最优性能,FID 降低至 3.92,颜色丰富度(CF)提升至 38.26,且 ΔCF 的退化可忽略不计。
- 消融实验表明,颜色解码器中的交叉注意力与自注意力层均至关重要,任一移除均导致性能显著下降。
- 采用多尺度特征的完整模型消除了明显的颜色渗色现象,并提升了边缘准确性,而单尺度变体在物体边界处表现出显著伪影。
- 在 COCO-Stuff 和 ADE20k 上,DDColor 在所有基线方法中表现最佳,且无需微调,展现出强大的泛化能力。
- 颜色查询的可视化显示,每个查询专门对应特定语义区域(如毛发、皮肤、草地),证实了其语义相关性与局部化颜色学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。