[论文解读] Sketch-Guided Text-to-Image Diffusion Models
本文提出了一种轻量级、可训练的潜在引导预测器(LGP),在推理过程中使用草图等空间图来引导预训练的文本到图像扩散模型,而无需微调主模型。LGP 是一个在数千张图像上训练的逐像素 MLP,能够将噪声潜在特征转化为空间引导,从而实现高质量、多样化的图像生成,且能忠实于草图布局——即使对于自由手绘或分布外的草图亦然,同时保持与文本提示的语义一致性。
Text-to-Image models have introduced a remarkable leap in the evolution of machine learning, demonstrating high-quality synthesis of images from a given text-prompt. However, these powerful pretrained models still lack control handles that can guide spatial properties of the synthesized images. In this work, we introduce a universal approach to guide a pretrained text-to-image diffusion model, with a spatial map from another domain (e.g., sketch) during inference time. Unlike previous works, our method does not require to train a dedicated model or a specialized encoder for the task. Our key idea is to train a Latent Guidance Predictor (LGP) - a small, per-pixel, Multi-Layer Perceptron (MLP) that maps latent features of noisy images to spatial maps, where the deep features are extracted from the core Denoising Diffusion Probabilistic Model (DDPM) network. The LGP is trained only on a few thousand images and constitutes a differential guiding map predictor, over which the loss is computed and propagated back to push the intermediate images to agree with the spatial map. The per-pixel training offers flexibility and locality which allows the technique to perform well on out-of-domain sketches, including free-hand style drawings. We take a particular focus on the sketch-to-image translation task, revealing a robust and expressive way to generate images that follow the guidance of a sketch of arbitrary style or domain. Project page: sketch-guided-diffusion.github.io
研究动机与目标
- 在推理过程中,通过来自另一领域(如草图)的空间图,实现对预训练文本到图像扩散模型的精确空间控制。
- 克服现有方法需要任务特定微调或在分布外草图上失效的局限性。
- 开发一种通用、高效且与领域无关的引导机制,适用于多种草图风格,包括自由手绘。
- 通过将其应用于显著性引导的图像修复和地平线控制,展示该方法在草图到图像之外的灵活性。
- 提供一种轻量级、可微分且逐像素的训练机制,避免大规模微调的需求。
提出的方法
- 训练一个名为潜在引导预测器(LGP)的小型逐像素多层感知机(MLP),将扩散模型主干网络的噪声潜在特征映射为空间引导图。
- LGP 采用自监督方式在数千张图像的小数据集上进行训练,损失函数在每个潜在像素上计算预测图与目标空间图(如草图)之间的差异。
- 训练使用与扩散过程相同的噪声调度,使 LGP 能够在采样过程中泛化至不同噪声水平。
- 该方法在每个潜在像素上独立运行,实现局部、灵活且与风格无关的引导,无需全局图像编码。
- 推理时,LGP 生成一个微分引导图,用于引导预训练扩散模型的去噪过程。
- 通过调整损失函数(如二元交叉熵)和监督信号,该方法可扩展至其他空间引导任务,如显著性引导的图像修复。
实验结果
研究问题
- RQ1轻量级的逐像素 MLP 是否能有效引导预训练的文本到图像扩散模型,使用如草图等空间图,而无需微调主模型?
- RQ2与域内或风格化草图相比,该方法在分布外草图(如自由手绘)上的泛化能力如何?
- RQ3在强制执行草图的空间布局时,该方法在多大程度上保持与文本提示的语义一致性?
- RQ4该框架是否可扩展至草图到图像之外的其他空间引导任务,如显著性引导的图像生成或地平线控制?
- RQ5与全局图像级编码相比,逐像素训练机制在灵活性、数据效率和对风格变化的鲁棒性方面表现如何?
主要发现
- 该方法实现了高质量的图像生成,既能忠实于文本提示的语义内容,又能准确反映多样化草图输入(包括自由手绘)的空间布局。
- 由于采用逐像素、局部训练,LGP 对分布外草图具有良好的泛化能力,避免了对特定笔触风格的过拟合。
- 该方法仅需数千张图像即可训练 LGP,与训练专用的图像到图像模型相比,显著降低了数据和计算成本。
- 该方法成功实现了显著性引导的图像修复,其中掩码区域的低显著性值导致背景补全,而高显著性值则生成前景对象。
- 该模型在不同噪声水平下表现稳健,即使在文本提示与草图语义模糊或冲突时也能有效应用。
- 失败案例多出现在复杂、杂乱或模糊的草图中,特别是当随机噪声初始化与草图结构冲突时,表明其在处理高语义模糊性方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。