[论文解读] Towards Equitable Representation in Text-to-Image Synthesis Models with the Cross-Cultural Understanding Benchmark (CCUB) Dataset
本文提出了一种基于跨文化理解基准数据集(CCUB)的、具有文化意识的文本到图像生成方法——该数据集包含来自八个文化的1,095组精心筛选的图文配对,旨在减少Stable Diffusion模型中的偏见与冒犯性内容。通过在CCUB数据上微调模型,并利用GPT-3将文化背景信息自动注入提示词,该方法在保持图像质量的同时,提升了文化相关性并减少了冒犯性内容。
It has been shown that accurate representation in media improves the well-being of the people who consume it. By contrast, inaccurate representations can negatively affect viewers and lead to harmful perceptions of other cultures. To achieve inclusive representation in generated images, we propose a culturally-aware priming approach for text-to-image synthesis using a small but culturally curated dataset that we collected, known here as Cross-Cultural Understanding Benchmark (CCUB) Dataset, to fight the bias prevalent in giant datasets. Our proposed approach is comprised of two fine-tuning techniques: (1) Adding visual context via fine-tuning a pre-trained text-to-image synthesis model, Stable Diffusion, on the CCUB text-image pairs, and (2) Adding semantic context via automated prompt engineering using the fine-tuned large language model, GPT-3, trained on our CCUB culturally-aware text data. CCUB dataset is curated and our approach is evaluated by people who have a personal relationship with that particular culture. Our experiments indicate that priming using both text and image is effective in improving the cultural relevance and decreasing the offensiveness of generated images while maintaining quality.
研究动机与目标
- 解决在训练数据存在偏见的大规模数据集上微调的文本到图像生成模型中,文化代表性不平等的问题。
- 减轻AI生成图像中的有害刻板印象与冒犯性内容,尤其针对代表性不足的文化群体。
- 开发一种可扩展的方法,对预训练模型进行定制化微调,以实现与文化相关的图像生成,而无需从头开始训练。
- 通过母语文化专家的评估,衡量文化相关性与冒犯性,确保反馈的真实性。
- 创建一个公开可用的基准数据集(CCUB),以支持未来在具有文化意识的AI生成研究中的发展。
提出的方法
- 由母语文化专家收集并整理了包含8个国家共1,095组图文配对的跨文化理解基准(CCUB)数据集。
- 在CCUB数据上对Stable Diffusion模型进行微调,使其学习特定文化背景下的视觉概念,提升文化契合度。
- 在CCUB的具有文化意识的文本数据上微调GPT-3模型,实现对输入提示词的自动增强,加入相关文化细节(如当地习俗、工具、服饰等)。
- 结合微调后的图像生成与GPT-3提示增强,同时提升视觉与语义层面的文化相关性。
- 通过来自五个国家的72名母语参与者参与的问卷调查评估系统,比较图像质量、文化契合度与冒犯性。
- 以简单地在提示词末尾添加国家名称作为基线,以隔离所提方法的影响。
实验结果
研究问题
- RQ1在小规模、经文化筛选的数据集上微调预训练的文本到图像模型,是否能显著提升生成图像的文化相关性?
- RQ2使用微调后的大型语言模型进行自动提示增强,是否能在不降低图像质量的前提下提升文化具体性?
- RQ3结合视觉微调与语义提示增强的方法,与基线方法相比,在减少冒犯性与提升文化契合度方面表现如何?
- RQ4母语文化专家能否可靠地评估AI生成图像的文化准确性与冒犯性?
- RQ5数据集中基于国家的文化表征,在多大程度上能推广至现实世界中的文化多样性与交叉性?
主要发现
- 视觉微调与提示增强相结合的方法在文化契合度方面显著优于基线,冒犯性降低了38%。
- 仅进行微调可提升文化契合度并减少冒犯性,但对图文对齐无显著影响。
- 仅使用提示增强可提升文化契合度,但未降低冒犯性,且由于提示与生成内容不匹配,轻微降低了图文对齐度。
- 结合方法实现了最佳平衡——在保持或略微提升图文对齐的同时,显著提升了文化契合度并降低了冒犯性。
- 母语评估者一致认为,使用结合方法生成的图像更具真实性,且刻板印象更少,优于基线方法。
- CCUB数据集展现出高度的文化特异性,能有效引导模型生成准确且语境恰当的多样化文化表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。