Skip to main content
QUICK REVIEW

[论文解读] Text to Image Generation: Leaving no Language Behind

Pedro Reviriego, Elena Merino-Gómez|arXiv (Cornell University)|Aug 19, 2022
Multimodal Machine Learning Applications被引用 12
一句话总结

本文研究了主流文本到图像生成器——DALL-E2、MidJourney 和 Craiyon 在英语、西班牙语、巴斯克语和拉丁语中的表现。研究发现,非英语和低资源语言的图像质量显著下降,尤其是拉丁语和巴斯克语;并提出将机器翻译转换为英语作为提升多语言一致性的可扩展解决方案。

ABSTRACT

One of the latest applications of Artificial Intelligence (AI) is to generate images from natural language descriptions. These generators are now becoming available and achieve impressive results that have been used for example in the front cover of magazines. As the input to the generators is in the form of a natural language text, a question that arises immediately is how these models behave when the input is written in different languages. In this paper we perform an initial exploration of how the performance of three popular text-to-image generators depends on the language. The results show that there is a significant performance degradation when using languages other than English, especially for languages that are not widely used. This observation leads us to discuss different alternatives on how text-to-image generators can be improved so that performance is consistent across different languages. This is fundamental to ensure that this new technology can be used by non-native English speakers and to preserve linguistic diversity.

研究动机与目标

  • 评估当前文本到图像生成器在多种语言(包括广泛使用和低资源语言)中的表现。
  • 识别使用非英语输入时,尤其是少数语言或古典语言时,性能下降的程度。
  • 探索在文本到图像生成中实现多语言一致性能的可行技术路径。
  • 倡导在人工智能生成图像系统中实现语言包容性,以支持全球语言多样性。

提出的方法

  • 使用相同文本提示在英语、西班牙语、巴斯克语和拉丁语中评估三种公开可用的文本到图像生成器——DALL-E2、MidJourney 和 Craiyon。
  • 使用 Google 翻译进行初始提示翻译,并由母语者和拉丁语专家验证和校正,以确保语言准确性。
  • 使用标准化提示在五个主题(火车、滑雪者、厨房、大象和客厅)上生成图像。
  • 通过视觉比较跨语言和模型的输出质量,重点关注语义保真度和视觉连贯性。
  • 提出一种模块化方法,其中语言检测和翻译模块在输入送入生成器前将其转换为英语。
  • 讨论了在多语言数据集上训练与利用现有机器翻译系统在可扩展性和可维护性方面的权衡。

实验结果

研究问题

  • RQ1当输入提示为非英语语言时,最先进的文本到图像生成器的性能如何变化?
  • RQ2对于巴斯克语等低资源或孤立语言,以及拉丁语等古典语言,性能下降到何种程度?
  • RQ3能否有效将机器翻译集成到文本到图像生成流程中以提升多语言一致性?
  • RQ4在多语言数据集上训练与使用翻译预处理之间的实际和计算权衡是什么?

主要发现

  • 所有三种文本到图像生成器——DALL-E2、MidJourney 和 Craiyon——在使用拉丁语提示生成图像时表现出显著的性能下降,输出通常无法捕捉预期场景。
  • 对于巴斯克语(一种无主要语言亲属的孤立语言),所有生成器均产生了低保真度或语义不准确的图像,表明对非印欧语系语言支持较差。
  • 与英语相比,西班牙语(一种广泛使用的罗曼语)表现出中等程度的性能下降,但在物体位置和细节方面仍存在明显不一致。
  • 非英语提示生成的图像在视觉质量和语义准确性方面始终较低,尤其对于训练数据有限的语言。
  • 本研究未发现当前生成器大规模训练于多语言文本-图像对的证据,表明性能差异源于数据稀缺,而非模型架构。
  • 将机器翻译作为预处理步骤集成被认定为一种可行、可扩展且灵活的替代方案,可避免对多语言数据集重新训练模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。