[论文解读] Learning Diverse Image Colorization
本文提出一种方法,通过变分自编码器(VAE)学习颜色场的低维潜在嵌入,并建模输入灰度特征与潜在码之间的多模态条件分布,从而为单张灰度图像生成多样且逼真的着色结果。该方法在生成具有更高感知质量与预测方差的多样化、空间一致着色结果方面,优于标准的CVAE和cGAN基线模型。
Colorization is an ambiguous problem, with multiple viable colorizations for a single grey-level image. However, previous methods only produce the single most probable colorization. Our goal is to model the diversity intrinsic to the problem of colorization and produce multiple colorizations that display long-scale spatial co-ordination. We learn a low dimensional embedding of color fields using a variational autoencoder (VAE). We construct loss terms for the VAE decoder that avoid blurry outputs and take into account the uneven distribution of pixel colors. Finally, we build a conditional model for the multi-modal distribution between grey-level image and the color field embeddings. Samples from this conditional model result in diverse colorization. We demonstrate that our method obtains better diverse colorizations than a standard conditional variational autoencoder (CVAE) model, as well as a recently proposed conditional generative adversarial network (cGAN).
研究动机与目标
- 为解决图像着色中固有的模糊性,生成针对单张灰度输入的多种逼真、多样的着色结果。
- 建模颜色场中的长程空间一致性,避免因逐像素独立采样导致的斑点噪声。
- 学习颜色场的平滑、低维潜在表示,以保留空间结构并实现高保真度解码。
- 构建多模态条件模型 $P(\mathbf{z}|\mathbf{G})$,从灰度特征中捕捉多样化的着色模式。
- 在CVAE和cGAN等现有方法的基础上,生成更多样化且感知上更自然的着色结果。
提出的方法
- 训练变分自编码器(VAE)将颜色场 $\mathbf{C}$ 编码为低维潜在码 $\mathbf{z}$,并采用自定义解码损失以减少模糊性并提升保真度。
- VAE引入特异性损失与色彩丰富度加权L1损失,以更好地处理像素颜色分布不平衡问题,并保留鲜艳色彩。
- 从预训练颜色化CNN的conv-7层提取灰度图像特征 $\mathbf{G}$,以捕获空间与颜色亲和信息。
- 使用混合密度网络(MDN)建模多模态条件分布 $P(\mathbf{z}|\mathbf{G})$,实现潜在码的多样化采样。
- 推理阶段,从 $P(\mathbf{z}|\mathbf{G})$ 中采样多个 $\mathbf{z}_k$,并解码为多样且空间一致的着色结果 $\mathbf{C}_k$。
- 该方法结合VAE重建与条件建模,平衡着色输出的多样性与真实感。
实验结果
研究问题
- RQ1能否学习到一个颜色场的低维潜在空间,使其保留空间一致性并支持高保真重建?
- RQ2如何构建多模态条件模型 $P(\mathbf{z}|\mathbf{G})$,以从单张灰度输入生成多样且逼真的着色结果?
- RQ3是否可通过考虑颜色分布不平衡与空间结构的损失函数,提升生成着色结果的质量与多样性?
- RQ4所提方法在生成多样、感知上合理的着色结果方面,相较于CVAE与cGAN基线模型表现如何?
- RQ5当缺乏真实多样性标注时,生成结果的方差在多大程度上可作为多样性的代理指标?
主要发现
- 与CVAE和cGAN相比,所提方法在多样化着色结果中表现出更高的方差,表明多样性更优,同时与真实值的最优误差保持相当。
- 引入特异性损失与色彩丰富度加权L1损失可减少模糊性,并提升感知质量,尤其在肤色及草地方、天空等鲜艳区域表现更优。
- 在LFW与LSUN Church数据集上,尽管未针对这些指标进行训练,该方法仍实现了低于标准L2损失的平均绝对误差与加权绝对误差。
- 定性结果表明,生成的着色结果在肤色、服装颜色与背景色调等方面具有多样性,有效捕捉了多种合理模式。
- 与CVAE和cGAN相比,该方法在生成多样、无伪影的着色结果方面表现更优;cGAN无法生成多样性,而CVAE则产生低方差且带噪声的输出。
- 基于VAE的潜在空间实现了高保真颜色场重建,而基于MDN的条件模型成功捕捉了多模态依赖关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。