[论文解读] Semi-Parametric Neural Image Synthesis
本文提出了一种半参数化的神经图像合成方法,结合小型扩散模型或自回归生成模型与外部图像数据库及检索机制。通过在训练和推理过程中基于数据库中的最近邻进行条件化,该模型在显著减少参数量的同时实现了最先进的FID分数,支持零样本领域迁移、文本到图像合成以及风格迁移而无需微调。
Novel architectures have recently improved generative image synthesis leading to excellent visual quality in various tasks. Much of this success is due to the scalability of these architectures and hence caused by a dramatic increase in model complexity and in the computational resources invested in training these models. Our work questions the underlying paradigm of compressing large training data into ever growing parametric representations. We rather present an orthogonal, semi-parametric approach. We complement comparably small diffusion or autoregressive models with a separate image database and a retrieval strategy. During training we retrieve a set of nearest neighbors from this external database for each training instance and condition the generative model on these informative samples. While the retrieval approach is providing the (local) content, the model is focusing on learning the composition of scenes based on this content. As demonstrated by our experiments, simply swapping the database for one with different contents transfers a trained model post-hoc to a novel domain. The evaluation shows competitive performance on tasks which the generative model has not been trained on, such as class-conditional synthesis, zero-shot stylization or text-to-image synthesis without requiring paired text-image data. With negligible memory and computational overhead for the external database and retrieval we can significantly reduce the parameter count of the generative model and still outperform the state-of-the-art.
研究动机与目标
- 挑战图像生成领域中通过扩大参数模型规模的主流范式,该范式需要大量计算资源并限制了可及性。
- 通过利用外部非参数化记忆,解决将共享视觉概念压缩到日益庞大的参数化表示中的低效问题。
- 通过仅更换检索数据库而不重新训练,实现对已训练模型的后处理适应,以支持新领域(如零样本风格迁移)。
- 在大幅减少参数量且检索计算开销极低的前提下,实现具有竞争力的生成性能。
提出的方法
- 使用CLIP共享的文本-图像嵌入空间,从外部图像数据库中检索最近邻,并以此条件化训练小型扩散或自回归生成模型。
- 通过scaNN实现可扩展的近似最近邻(ANN)搜索,实现在CLIP潜在空间中每推理一次在1毫秒内检索最多20个最近邻。
- 通过交叉注意力机制,将检索到的最近邻的展平、按扫描顺序排列的潜在表示(例如,4个8×8×256的邻近图像 → 64×1024的输入)作为条件输入生成模型。
- 通过将生成模型与内容记忆需求解耦,使其专注于基于检索样本的构图与编辑。
- 通过在推理时将训练数据库替换为新数据库(如WikiArt),实现零样本泛化,使同一模型能够生成风格化或文本条件图像而无需微调。
- 将模型特定的采样技术(如扩散模型的无分类器引导、自回归模型的top-k采样)与基于检索的条件化相结合。
实验结果
研究问题
- RQ1当结合大规模外部图像数据库和检索机制时,小型参数化生成模型是否能够实现最先进的图像合成性能?
- RQ2在不重新训练的前提下,通过更换检索数据库,一个在某一数据集(如ImageNet)上训练的模型在新领域(如艺术风格)上的泛化能力有多强?
- RQ3检索增强生成是否能减少对巨大参数量的需求,同时保持或提升样本质量和多样性?
- RQ4在同时使用CLIP文本嵌入和检索到的图像邻近样本作为条件时,模型对未见或虚构文本提示的泛化能力如何?
- RQ5所提方法是否能通过单一固定参数生成器支持多种条件生成任务(如文本到图像、类别条件生成和零样本风格迁移)?
主要发现
- 检索增强扩散模型(RDM)在ImageNet上的Fréchet Inception Distance(FID)达到5.69,优于无条件SOTA的ADM模型(FID 6.25),且参数量显著更少。
- 尽管在训练过程中未使用类别标签,RDM模型在FID上仍优于类别条件ADM模型(5.69 vs. 6.25),表明其在无类别监督下具备更强的生成能力。
- 通过将训练数据库替换为WikiArt数据集,同一RDM模型实现了零样本风格迁移,无需微调即可从文本提示生成多样且高保真度的图像。
- 当同时使用CLIP文本嵌入及其最近邻时,模型能有效泛化至未见和虚构的文本提示(如“一只穿斑马皮的熊猫”),但若仅依赖文本嵌入则会失败。
- 检索机制仅增加0.95毫秒的推理延迟和每100万张图像2GB的存储开销,表明尽管性能优异,其计算和存储开销可忽略不计。
- 自回归检索模型(RARM)也取得了优异结果,以极少的参数量生成多样且高保真度的样本,并支持top-k采样以实现可控生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。