[论文解读] DiffColor: Toward High Fidelity Text-Guided Image Colorization with Diffusion Models
DiffColor 提出了一种两阶段扩散模型框架,用于高保真、文本引导的图像着色,该框架利用预训练的文本到图像模型和基于 CLIP 的对比损失,仅通过自然语言提示即可生成鲜艳、多样且语义一致的颜色,无需额外输入。它通过优化的文本嵌入和空间对齐实现上下文内着色与对象级控制,在视觉质量、色彩保真度和多样性方面优于先前方法。
Recent data-driven image colorization methods have enabled automatic or reference-based colorization, while still suffering from unsatisfactory and inaccurate object-level color control. To address these issues, we propose a new method called DiffColor that leverages the power of pre-trained diffusion models to recover vivid colors conditioned on a prompt text, without any additional inputs. DiffColor mainly contains two stages: colorization with generative color prior and in-context controllable colorization. Specifically, we first fine-tune a pre-trained text-to-image model to generate colorized images using a CLIP-based contrastive loss. Then we try to obtain an optimized text embedding aligning the colorized image and the text prompt, and a fine-tuned diffusion model enabling high-quality image reconstruction. Our method can produce vivid and diverse colors with a few iterations, and keep the structure and background intact while having colors well-aligned with the target language guidance. Moreover, our method allows for in-context colorization, i.e., producing different colorization results by modifying prompt texts without any fine-tuning, and can achieve object-level controllable colorization results. Extensive experiments and user studies demonstrate that DiffColor outperforms previous works in terms of visual quality, color fidelity, and diversity of colorization options.
研究动机与目标
- 解决传统和基于参考图像的图像着色方法存在的局限性,这些方法常产生暗淡、不一致或模糊的颜色。
- 仅通过自然语言提示实现精确、多样且鲜艳的着色,无需用户提供的涂抹痕迹或参考图像。
- 实现上下文内着色——仅通过修改文本提示即可生成不同的着色结果,而无需微调或重新训练。
- 通过优化文本嵌入以与特定图像区域对齐,实现对象级可控着色。
- 在准确传递文本到图像的颜色语义的同时,保持结构和背景的完整性。
提出的方法
- 使用基于 CLIP 的对比损失微调预训练的文本到图像扩散模型,将着色图像及其对应的文本提示视为正样本对,将无关的反向颜色文本视为负样本对。
- 在推理过程中优化文本嵌入,使生成的着色图像与目标文本提示对齐,从而实现无需微调的上下文内着色。
- 通过 CoCosNet 使用空间对齐模块,将输入灰度图像的结构细节传递到扩散模型生成的输出中,以保持图像布局和精细细节。
- 采用两阶段流程:首先通过对比微调生成具有生成性颜色先验的初始着色;其次通过优化的文本嵌入和高质量重建对结果进行细化。
- 利用基于 DDIM 的采样方法实现高效且高保真的图像生成,支持近乎完美的图像反演和快速推理。
- 引入插值参数 η 以平衡内容和颜色引导,从而在提示模糊或不精确时实现灵活控制。
实验结果
研究问题
- RQ1当仅以文本提示作为条件时,预训练的扩散模型能否生成高保真、多样且语义准确的着色结果,而无需额外输入?
- RQ2该方法能否实现上下文内着色——仅通过修改提示即可生成不同的着色结果,而无需微调或重新训练?
- RQ3该方法能否通过将文本嵌入与特定图像区域对齐,实现对象级可控着色?
- RQ4空间对齐模块在传递颜色的同时,对保持结构细节的效果如何?
- RQ5与基线着色方法相比,对比损失在提升颜色保真度和多样性方面有多大的改进作用?
主要发现
- 用户研究表明,DiffColor 在图像质量和语义一致性方面均获得最高评分,优于以往的最先进方法。
- 消融实验证明,空间对齐将第一阶段的 PSNR 从 21.13 提升至 29.83,SSIM 从 0.7643 提升至 0.9063,显著增强了结构保持能力。
- 基于 CLIP 的正负样本对对比损失能有效将颜色输出限制在合理颜色空间内,并提升颜色保真度。
- 第二阶段在真实彩色图像上的应用表明,其作为语义着色编辑工具具有高度通用性,且独立于两阶段流程。
- 插值参数 η 实现了灵活控制:增加 η 可使用户在提示模糊或不精确时探索更多颜色变化。
- 用户研究证实,与基线方法相比,DiffColor 生成的图像更加鲜艳、丰富且语义一致,尤其在对象颜色模糊的复杂场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。