[论文解读] Gender Bias in Multimodal Models: A Transnational Feminist Approach Considering Geographical Region and Culture
本文提出一种跨国女性主义框架,用于审计CLIP等多模态模型中的性别偏见,结合地理区域与文化背景。通过跨全球区域的余弦相似度评分,发现社会性别不平等(以全球性别差距指数衡量)与模型偏见之间存在强烈相关性,全球南方地区尤其表现出更强的刻板印象——例如,身着保守服饰的女性被强烈关联到“恐怖主义”和传统性别角色。
Deep learning based visual-linguistic multimodal models such as Contrastive Language Image Pre-training (CLIP) have become increasingly popular recently and are used within text-to-image generative models such as DALL-E and Stable Diffusion. However, gender and other social biases have been uncovered in these models, and this has the potential to be amplified and perpetuated through AI systems. In this paper, we present a methodology for auditing multimodal models that consider gender, informed by concepts from transnational feminism, including regional and cultural dimensions. Focusing on CLIP, we found evidence of significant gender bias with varying patterns across global regions. Harmful stereotypical associations were also uncovered related to visual cultural cues and labels such as terrorism. Levels of gender bias uncovered within CLIP for different regions aligned with global indices of societal gender equality, with those from the Global South reflecting the highest levels of gender bias.
研究动机与目标
- 调查CLIP等多模态模型中的性别偏见如何在不同地理区域和文化背景下变化。
- 应用跨国女性主义理论,分析超越西方中心框架的交叉性性别偏见。
- 评估社会层面的性别不平等是否与多模态嵌入中的模型层面性别偏见存在可测量的相关性。
- 揭示文化视觉线索(如头巾、服饰)如何在模型预测中导致刻板印象关联。
- 评估训练数据偏见(尤其是来自英语互联网来源的数据)对性别与区域刻板印象的影响。
提出的方法
- 构建了一个涵盖多样化地理区域的全球图像数据集,聚焦于文化与区域多样性,包含男性与女性的图像。
- 使用CLIP的文本与图像编码器,计算按区域和性别划分的文本性别描述词(形容词、职业)与图像嵌入之间的余弦相似度。
- 应用Grad-CAM可视化技术,识别对模型预测贡献最大的图像区域(如头巾),例如模型将“恐怖分子”与佩戴头饰的女性关联。
- 将区域特定的性别差异得分(男性与女性术语相似度的差异)与全球性别差距指数(GGI)进行相关分析。
- 通过形容词(如“体贴”、“优雅”)和职业(如“助产士”、“建筑师”)在不同区域的分析,检测性别偏见模式。
- 采用统计分析(皮尔逊相关性)检验GGI得分与模型偏见指标之间的关系,报告r值与p值。

实验结果
研究问题
- RQ1CLIP中的性别偏见在不同地理区域与文化背景下如何变化?
- RQ2文化视觉线索(如服饰)在多模态模型预测中在多大程度上影响刻板印象关联?
- RQ3社会层面的性别平等(以全球性别差距指数衡量)与CLIP嵌入中观察到的性别偏见程度之间是否存在可测量的相关性?
- RQ4区域特定的性别化职业与形容词表征在多大程度上反映或放大了既有的社会刻板印象?
- RQ5模型偏见在多大程度上由主要来自英语互联网来源的训练数据所塑造?
主要发现
- 在形容词方面,全球性别差距指数与性别差异得分之间存在显著负相关性(r = -0.84,p = 0.003),表明性别平等程度越低的地区,模型偏见越高。
- 南亚、西亚和北非地区在形容词关联中表现出最高的性别偏见,尤其将女性与“体贴”、“优雅”和“娇弱”等词关联。
- 在职业方面,东亚与东南亚女性图像与“助产士”、“家庭保姆”和“图书管理员”等词的相似度最高,反映出区域性的性别角色刻板印象。
- 佩戴头巾的女性图像在CLIP预测中更强烈地与“恐怖分子”一词关联,这一发现通过Grad-CAM注意力图谱(突出头饰区域)得到证实。
- 职业方面的GGI与性别偏见之间的相关性同样显著(r = -0.78,p = 0.0012),进一步强化了社会不平等与模型偏见之间的关联。
- 欧洲、北美和东亚地区的性别差异得分最低,且在全球性别差距指数中排名最高,表明在性别更平等的社会中,模型偏见也更小。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。