[论文解读] M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers
M6-UFC 提出了一种非自回归、基于 BERT 的两阶段框架,通过将所有输入和输出表示为离散标记序列,统一了文本、视觉和保留控制,用于条件图像生成。该方法在 M2C-Fashion 和多模态 CelebA-HQ 上实现了最先进(SOTA)的 FID 分数,推理速度比自回归基线快 11 倍,同时通过采用专用相关性与保真度估计器的渐进式非自回归生成算法,保持了高保真度和控制一致性。
Conditional image synthesis aims to create an image according to some multi-modal guidance in the forms of textual descriptions, reference images, and image blocks to preserve, as well as their combinations. In this paper, instead of investigating these control signals separately, we propose a new two-stage architecture, M6-UFC, to unify any number of multi-modal controls. In M6-UFC, both the diverse control signals and the synthesized image are uniformly represented as a sequence of discrete tokens to be processed by Transformer. Different from existing two-stage autoregressive approaches such as DALL-E and VQGAN, M6-UFC adopts non-autoregressive generation (NAR) at the second stage to enhance the holistic consistency of the synthesized image, to support preserving specified image blocks, and to improve the synthesis speed. Further, we design a progressive algorithm that iteratively improves the non-autoregressively generated image, with the help of two estimators developed for evaluating the compliance with the controls and evaluating the fidelity of the synthesized image, respectively. Extensive experiments on a newly collected large-scale clothing dataset M2C-Fashion and a facial dataset Multi-Modal CelebA-HQ verify that M6-UFC can synthesize high-fidelity images that comply with flexible multi-modal controls.
研究动机与目标
- 将文本、视觉和保留控制等多种模态控制统一到一个可扩展的框架中,用于条件图像生成。
- 克服自回归生成在速度、整体一致性以及处理保留控制方面的局限性。
- 开发一种非自回归生成策略,在保持图像质量和控制一致性的同时,实现更快的推理速度。
- 设计一种渐进式推理算法,配备专用的估计器以分别评估相关性与保真度,从而迭代提升生成图像的质量。
提出的方法
- 使用基于 VQ-VAE 的第一阶段编码器,将所有控制信号和生成图像表示为离散标记序列,实现在 Transformer 中的统一处理。
- 采用双向 Transformer(类似 BERT)实现非自回归图像生成,相比自回归模型具有完整的上下文访问能力,从而实现更快的推理速度。
- 在训练过程中使用掩码序列建模目标,以条件化方式预测被掩码的图像标记,条件为多模态控制和未被掩码的标记。
- 提出一种渐进式非自回归生成算法(PNAG),通过两个估计器迭代重预测低置信度的标记:一个用于控制一致性(相关性),一个用于图像质量(保真度)。
- 在推理过程中引入两个判别性估计器:一个用于评估与控制信号的一致性(相关性估计器),一个用于评估感知质量(保真度估计器)。
- 在 PNAG 中采用动态掩码策略,每轮迭代中选择置信度最低的前 B 个标记进行重预测,从而提升收敛速度与图像质量。
实验结果
研究问题
- RQ1统一框架能否有效处理条件图像生成中任意组合的文本、视觉和保留控制?
- RQ2与自回归方法相比,使用双向上下文的非自回归生成是否能提升图像质量和一致性?
- RQ3配备专用估计器的渐进式非自回归推理策略是否能在保真度和控制一致性方面超越标准非自回归方法?
- RQ4当组合多种控制模态时,该方法在性能和速度上的可扩展性如何?
- RQ5超参数(如渐进式非自回归算法中的并行重预测数量 B)的影响是什么?
主要发现
- M6-UFC 在 M2C-Fashion 上实现了 11.14 的最先进 FID 分数,在多模态 CelebA-HQ 上实现了 65.30 的 FID 分数,优于 TediGAN 和 VQGAN 的关键指标。
- 该模型推理速度比自回归 VQGAN 基线快 11 倍,同时在所有指标上保持或提升了图像质量。
- 消融实验表明,配备相关性与保真度估计器的渐进式非自回归生成算法在 FID 和 LPIPS 分数上均优于标准掩码预测方法,说明其能有效提升图像质量。
- 消融研究证实,相关性与保真度估计器均不可或缺,移除任一都会导致性能下降。
- 将并行重预测数量 B 从 1 增加到 10,FID 和 LPIPS 分数持续改善,表明 PNAG 策略具有良好的可扩展性与鲁棒性。
- 可视化示例显示,M6-UFC 即使在处理反事实文本描述时,也能成功生成高保真图像,展现出强大的控制对齐能力与真实感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。