[论文解读] MultiFusion: Fusing Pre-Trained Models for Multi-Lingual, Multi-Modal Image Generation
MultiFusion 引入了一种多语言、多模态扩散模型,通过融合预训练的语言、视觉和嵌入模型,实现复杂且交错的文本与图像提示用于图像生成。通过使用适配器和注意力机制调控对预训练组件进行对齐,该模型在无需多语言微调的情况下实现了多语言能力,与从零开始训练相比,训练计算量减少了 95%。
The recent popularity of text-to-image diffusion models (DM) can largely be attributed to the intuitive interface they provide to users. The intended generation can be expressed in natural language, with the model producing faithful interpretations of text prompts. However, expressing complex or nuanced ideas in text alone can be difficult. To ease image generation, we propose MultiFusion that allows one to express complex and nuanced concepts with arbitrarily interleaved inputs of multiple modalities and languages. MutliFusion leverages pre-trained models and aligns them for integration into a cohesive system, thereby avoiding the need for extensive training from scratch. Our experimental results demonstrate the efficient transfer of capabilities from individual modules to the downstream model. Specifically, the fusion of all independent components allows the image generation module to utilize multilingual, interleaved multimodal inputs despite being trained solely on monomodal data in a single language.
研究动机与目标
- 通过任意交错的多模态和多语言输入,实现表达性强、复杂的图像生成。
- 将预训练语言模型的多语言能力迁移到下游图像生成任务中,而无需多语言微调数据。
- 通过利用模块化、预训练组件,减少多语言、多模态扩散模型的训练计算量。
- 开发一个用于评估多模态提示中组合理解能力的基准。
- 提供一个灵活、模块化的框架,将多样化预训练模型整合到统一的生成系统中。
提出的方法
- MultiFusion 以解码器语言模型为核心,通过为视觉和语义搜索微调的适配器进行增强。
- 通过适配器和偏置模块对齐视觉和文本编码器,以在扩散模型中实现交叉注意力条件化。
- 交叉注意力机制使扩散模型能够基于语言模型的嵌入进行条件化,推理时使用多模态输入。
- 应用注意力机制调控技术,以控制生成过程中视觉和文本输入的影响。
- 模型仅在单语言、仅英文数据上进行训练,多语言能力通过语言模型编码器实现迁移。
- 引入一个新基准 MCC-250,用于评估多模态提示中的组合泛化能力。

实验结果
研究问题
- RQ1扩散模型是否能够在无需多模态或多语言训练数据的情况下,使用任意交错的文本和图像提示生成高质量图像?
- RQ2预训练语言模型的多语言能力在多大程度上可以迁移到下游图像生成任务中?
- RQ3注意力机制调控在控制生成过程中视觉和文本输入影响方面有多有效?
- RQ4基于适配器的模块化预训练模型融合是否能够以显著降低的计算量,实现与端到端训练模型相当的性能?
- RQ5该模型在结合多种模态和语言的组合提示上泛化能力如何?
主要发现
- 尽管仅在英文数据上进行训练,MultiFusion 仍能成功使用跨五种语言的交错文本和图像提示生成高保真图像。
- 该模型通过利用底层语言模型的多语言能力实现多语言图像生成,无需多语言微调。
- 适配器和注意力机制调控的使用,使生成过程中对视觉和文本输入影响的控制更加精确。
- 与从零开始训练类似扩散模型相比,该模型将训练计算量减少了 95% 以上。
- MCC-250 基准表明,MultiFusion 在复杂多模态提示中表现出良好的组合泛化能力,在组合理解方面优于基线模型。
- 尽管在精确图像复制方面存在局限,该模型能有效将输入图像用作风格或结构参考,且性能对输入图像的质量和构图敏感。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。