[论文解读] Exploiting Cultural Biases via Homoglyphs in Text-to-Image Synthesis
本文揭示,在文本提示中插入单个同形字(视觉上相似的非拉丁字符)会引发 DALL-E 2 和 Stable Diffusion 等文本到图像模型中的文化偏见,反映出与字符所来源文字的文化关联的刻板印象。为缓解此问题,作者提出同形字去学习(homoglyph unlearning)方法,通过微调使文本编码器对这类操纵具备鲁棒性,而无需完全重新训练。
Models for text-to-image synthesis, such as DALL-E~2 and Stable Diffusion, have recently drawn a lot of interest from academia and the general public. These models are capable of producing high-quality images that depict a variety of concepts and styles when conditioned on textual descriptions. However, these models adopt cultural characteristics associated with specific Unicode scripts from their vast amount of training data, which may not be immediately apparent. We show that by simply inserting single non-Latin characters in a textual description, common models reflect cultural stereotypes and biases in their generated images. We analyze this behavior both qualitatively and quantitatively, and identify a model's text encoder as the root cause of the phenomenon. Additionally, malicious users or service providers may try to intentionally bias the image generation to create racist stereotypes by replacing Latin characters with similarly-looking characters from non-Latin scripts, so-called homoglyphs. To mitigate such unnoticed script attacks, we propose a novel homoglyph unlearning method to fine-tune a text encoder, making it robust against homoglyph manipulations.
研究动机与目标
- 探究非拉丁同形字在文本提示中如何影响文本到图像生成中的文化偏见。
- 识别文本编码器是多模态模型中基于脚本的文化偏见的根本原因。
- 证明单个字符的同形字插入可微妙但显著地改变图像生成结果,使其趋向特定文化刻板印象。
- 提出一种缓解策略——同形字去学习,以增强模型对基于脚本的提示操纵的鲁棒性。
- 提高对生成式人工智能中隐藏偏见的认识,推动多模态系统的公平性。
提出的方法
- 作者通过在标准拉丁语提示中注入同形字(如韩文谚文、印度奥里亚文、阿拉伯文)来分析 DALL-E 2 和 Stable Diffusion。
- 通过定性和定量评估测量生成图像内容的变化,重点关注面部特征、服饰和文化属性。
- 根源被追溯至文本编码器对非拉丁文字字符的敏感性,这些字符从训练数据中编码了文化关联。
- 提出一种新颖的微调方法,称为同形字去学习,使文本编码器对同形字替换保持不变。
- 该方法无需完整重训练即可应用,同时保持模型性能并减少由脚本注入引发的偏见。
- 实验使用如“a photo of an actress”等提示进行同形字替换,结果在多种脚本和模型间进行分析。
实验结果
研究问题
- RQ1非拉丁脚本的同形字如何影响文本到图像生成中的文化表征?
- RQ2为何插入单个同形字会显著引发生成图像中的文化偏见?
- RQ3能否在不损害性能的前提下使文本编码器对同形字操纵具备鲁棒性?
- RQ4不同 Unicode 脚本(如谚文、奥里亚文、阿拉伯文)在多大程度上影响生成图像中反映的文化刻板印象?
- RQ5此类偏见对公平性、用户自主权以及生成式 AI 的潜在滥用有何影响?
主要发现
- 在提示中插入来自非拉丁脚本(如韩文谚文或印度奥里亚文)的单个同形字,会导致 DALL-E 2 和 Stable Diffusion 生成反映特定文化刻板印象的图像,如东亚或南亚的面部特征和服饰。
- 文本编码器被确定为基于脚本的文化偏见的主要来源,因其从训练数据中编码了文化关联。
- 同形字去学习方法成功减少了由同形字引发的偏见,使文本编码器对这类字符替换保持不变。
- 该方法在无需完整重训练的情况下实现对同形字攻击的鲁棒性,同时保持图像质量和语义保真度。
- 该偏见效应虽微妙但可察觉,可能被用于强化有害刻板印象,尤其当用户未察觉操纵时。
- 该现象在多个模型和脚本间保持一致,表明这是在基于多样化互联网数据训练的多模态模型中广泛存在的问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。