[论文解读] Unified Discrete Diffusion for Simultaneous Vision-Language Generation
本文提出UniD3,一种统一的离散扩散模型,通过单一架构同时实现视觉-语言生成与模态转换。通过引入统一的转移矩阵和融合嵌入的互 attention 机制,UniD3 建模了文本与图像标记的联合分布,在无条件图像-文本生成与双向生成任务中均达到最先进性能。
The recently developed discrete diffusion models perform extraordinarily well in the text-to-image task, showing significant promise for handling the multi-modality signals. In this work, we harness these traits and present a unified multimodal generation model that can conduct both the "modality translation" and "multi-modality generation" tasks using a single model, performing text-based, image-based, and even vision-language simultaneous generation. Specifically, we unify the discrete diffusion process for multimodal signals by proposing a unified transition matrix. Moreover, we design a mutual attention module with fused embedding layer and a unified objective function to emphasise the inter-modal linkages, which are vital for multi-modality generation. Extensive experiments indicate that our proposed method can perform comparably to the state-of-the-art solutions in various generation tasks.
研究动机与目标
- 将视觉-语言生成与模态转换统一到单一模型中,克服专用架构的局限性。
- 设计一个统一的马尔可夫转移矩阵,实现在离散潜在空间中对混合文本与图像标记的稳定破坏与去噪。
- 通过融合嵌入的互 attention 机制增强跨模态理解,改善联合分布中的模态间关联。
- 设计一个统一的目标函数,简化优化过程并强化多模态信号的联合建模。
- 在单一框架下展示模型在无条件生成与双向生成(如文本到图像、图像到文本)任务中的能力。
提出的方法
- 使用离散变分自编码器(dVAE)将图像转换为离散标记,并对文本应用字节对编码(BPE),实现跨模态的共享潜在表示。
- 引入统一的转移矩阵,控制融合文本与图像标记的扩散过程,支持混合模态的稳定破坏与去噪。
- 采用融合嵌入层的互 attention 机制,在去噪过程中建模跨模态依赖关系。
- 设计统一的目标函数,联合优化文本与图像重建,提升对齐与连贯性。
- 采用两阶段训练框架:首先离线预训练 dVAE 和 BPE 编码器,然后在离散潜在码上训练统一的扩散模型。
- 在同一架构中支持条件生成(如文本引导的图像生成)与无条件生成(如联合图像-文本对合成)。
实验结果
研究问题
- RQ1单一离散扩散模型能否有效建模视觉与语言模态的联合分布?
- RQ2如何设计统一的转移矩阵,以实现在混合文本与图像标记上的稳定扩散?
- RQ3融合嵌入的互 attention 机制对跨模态生成质量有何影响?
- RQ4同一模型能否在无架构特化的情况下同时完成模态转换与多模态生成任务?
- RQ5与独立目标函数相比,统一目标函数在训练稳定性和生成质量方面表现如何?
主要发现
- UniD3 在无条件图像生成基准上实现了与最先进模型相当的图像质量,表现优异。
- 在图像字幕生成任务中,模型表现与 SOTA 方法相当,展示了从图像潜在表示中生成零样本文本的强大能力。
- 消融实验表明,移除统一转移矩阵会显著降低性能(FID:32.63 vs. 16.19),证实其关键作用。
- 互 attention 机制对性能贡献显著,移除后 FID 上升 5.46 点(21.65 vs. 16.19)。
- 统一转移矩阵提升了稳定性和性能,使用快速采样(Δt = 10)相比标准采样,FID 改善 2.14 点。
- 该模型成功在单一架构中支持多种任务,包括无条件图像-文本生成、文本引导的图像补全以及图像条件下的字幕生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。