Skip to main content
QUICK REVIEW

[论文解读] AltDiffusion: A Multilingual Text-to-Image Diffusion Model

Fulong Ye, Guang Liu|arXiv (Cornell University)|Aug 19, 2023
Image Retrieval and Classification TechniquesComputer Science被引用 3
一句话总结

AltDiffusion 是一个支持 18 种语言(包括低资源语言和文化语境复杂的语言)的多语言文本到图像扩散模型,通过蒸馏多语言文本编码器并采用两阶段训练方案微调预训练的仅支持英语的扩散模型实现。它在理解文化特定概念方面优于基于翻译的 Stable Diffusion 和现有多语言模型,同时保持了高质量的图像生成效果。

ABSTRACT

Large Text-to-Image(T2I) diffusion models have shown a remarkable capability to produce photorealistic and diverse images based on text inputs. However, existing works only support limited language input, e.g., English, Chinese, and Japanese, leaving users beyond these languages underserved and blocking the global expansion of T2I models. Therefore, this paper presents AltDiffusion, a novel multilingual T2I diffusion model that supports eighteen different languages. Specifically, we first train a multilingual text encoder based on the knowledge distillation. Then we plug it into a pretrained English-only diffusion model and train the model with a two-stage schema to enhance the multilingual capability, including concept alignment and quality improvement stage on a large-scale multilingual dataset. Furthermore, we introduce a new benchmark, which includes Multilingual-General-18(MG-18) and Multilingual-Cultural-18(MC-18) datasets, to evaluate the capabilities of T2I diffusion models for generating high-quality images and capturing culture-specific concepts in different languages. Experimental results on both MG-18 and MC-18 demonstrate that AltDiffusion outperforms current state-of-the-art T2I models, e.g., Stable Diffusion in multilingual understanding, especially with respect to culture-specific concepts, while still having comparable capability for generating high-quality images. All source code and checkpoints could be found in https://github.com/superhero-7/AltDiffuson.

研究动机与目标

  • 解决现有文本到图像扩散模型仅支持有限语言(主要为英语、中文和日语)的局限性。
  • 实现从 18 种多样化语言的提示词中生成高质量图像,覆盖全球 46.94% 的第一语言使用者和 27.64% 的第二语言使用者。
  • 克服非英语提示词中因翻译导致的错误和信息丢失,特别是针对姓名和艺术传统等文化特定概念。
  • 开发一个全面的基准测试,用于评估多语言文本到图像生成在一般图像质量和文化特定概念理解两方面的表现。
  • 确保与现有下游工具(如 ControlNet 和 LoRA)兼容,以在实际应用中实现更强的可控性。

提出的方法

  • 使用知识蒸馏训练一个多语言文本编码器,将 18 种语言嵌入共享语义空间。
  • 将冻结的多语言文本编码器作为文本编码器头集成到预训练的仅支持英语的扩散模型(如 Stable Diffusion)中。
  • 采用两阶段训练方案:第一阶段,仅使用 LAION-5B 数据集对 UNet 的 K 和 V 矩阵进行微调,以实现跨注意力对齐;第二阶段,解冻 UNet 的所有参数,并在 LAION Aesthetics 数据集上进行微调,以提升图像质量。
  • 在训练过程中使用无分类器引导(classifier-free guidance),以增强生成图像的质量和多样性。
  • 利用多语言数据集(LAION-5B)进行初始对齐,使用高质量子集(LAION Aesthetics)进行最终优化。
  • 通过保留原始模型架构和权重结构,确保与下游工具(如 ControlNet 和 LoRA)的兼容性。

实验结果

研究问题

  • RQ1能否在保持高质量图像和语义对齐的前提下,有效训练一个支持 18 种多样化语言的多语言文本到图像扩散模型?
  • RQ2该模型在多语言理解方面与基于翻译的方法相比表现如何,特别是在文化特定概念方面?
  • RQ3该模型在无需翻译或重新编码的情况下,对混合语言提示词的泛化能力如何?
  • RQ4两阶段训练策略是否能在多语言设置中有效平衡跨注意力对齐与图像质量提升?
  • RQ5该模型在不同语言中对文化语境复杂的概念(如传统艺术、姓名和地域习语)的表现如何?

主要发现

  • 在 MC-18 基准测试中,AltDiffusion 在所有 18 种语言上的 CLIP 相似度(CLIP Sim)均优于基于翻译的 Stable Diffusion,平均得分分别为 0.769 和 0.231。
  • 在 MC-18 基准测试中,AltDiffusion 在文化特定概念理解(平均 4.125)和图文一致性(平均 3.775)方面的人工评估得分均高于基于翻译的 SD,表明其在多语言理解方面表现更优。
  • 在 MG-18 基准测试中,AltDiffusion 的 FID、IS 和 CLIP Sim 得分均超过现有多语言模型(如 Taiyi 和日语版 SD),展现出当前最先进的通用图像质量和对齐性能。
  • 该模型能生成文化上准确的输出——例如中国传统绘画和日本樱花场景——而基于翻译的 SD 则生成风格不匹配的结果,如油画或写实图像。
  • AltDiffusion 成功支持混合语言提示词(如中-韩、泰-英),在无需翻译步骤的情况下生成连贯且语境准确的图像。
  • 该模型与 ControlNet 和 LoRA 完全兼容,可在不修改架构的前提下实现图像生成的高级控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。