[论文解读] Assessing Multilingual Fairness in Pre-trained Multimodal Representations
本文引入了多语言个体公平性与群体公平性度量,用于评估 CLIP 等预训练多模态模型在不同语言间的公平性。研究发现,尽管语义相似性在语言间得以保持(个体公平性),但严重准确率差异依然存在,尤其在低资源语言中更为显著,导致在种族、性别和年龄群体间产生偏差预测,揭示了多语言多模态人工智能中的关键公平性缺口。
Recently pre-trained multimodal models, such as CLIP, have shown exceptional capabilities towards connecting images and natural language. The textual representations in English can be desirably transferred to multilingualism and support downstream multimodal tasks for different languages. Nevertheless, the principle of multilingual fairness is rarely scrutinized: do multilingual multimodal models treat languages equally? Are their performances biased towards particular languages? To answer these questions, we view language as the fairness recipient and introduce two new fairness notions, multilingual individual fairness and multilingual group fairness, for pre-trained multimodal models. Multilingual individual fairness requires that text snippets expressing similar semantics in different languages connect similarly to images, while multilingual group fairness requires equalized predictive performance across languages. We characterize the extent to which pre-trained multilingual vision-and-language representations are individually fair across languages. However, extensive experiments demonstrate that multilingual representations do not satisfy group fairness: (1) there is a severe multilingual accuracy disparity issue; (2) the errors exhibit biases across languages conditioning the group of people in the images, including race, gender and age.
研究动机与目标
- 探究预训练的多语言多模态模型在公平性方面是否对所有语言一视同仁。
- 解决多语言多模态表征学习中系统性公平性评估的缺失问题。
- 通过视觉定位作为锚点,形式化多语言多模态场景下的公平性概念——个体公平性与群体公平性。
- 通过实证方法证明多语言模型在语言和交叉性人口群体之间存在显著的准确率差异。
- 强调视觉表征选择对群体公平性度量的影响,警示下游应用中的潜在风险。
提出的方法
- 将多语言个体公平性定义为:在不同语言中语义等价的文本片段应与同一张图像产生相等的关联。
- 将多语言群体公平性定义为:在下游任务中,所有语言的预测性能应保持一致。
- 以 CLIP 作为基础模型,将图像和多语言文本编码到共享嵌入空间,用于计算相似度。
- 利用 FairFace 数据集,其包含人工标注的属性(种族、性别、年龄),以评估在语言和人口群体维度上的群体公平性。
- 构建中性、描述性的文本提示,确保在不同语言中使用相同的数值年龄,以隔离语言偏差与语义差异。
- 通过图像嵌入与文本嵌入之间的余弦相似度测量相似度得分,以评估模型对齐程度与公平性。
实验结果
研究问题
- RQ1预训练的多语言多模态模型在多大程度上满足多语言个体公平性?即语义等价的文本在不同语言中应产生相似的图像对齐结果。
- RQ2多语言群体公平性是否成立?即模型在下游视觉-语言任务中是否在所有语言中表现一致?
- RQ3在使用种族、性别和年龄等受保护属性进行评估时,准确率差异在不同语言间如何变化?
- RQ4在多语言设置中,视觉表征的选择在多大程度上影响群体公平性度量?
- RQ5即使文本提示中的数值年龄在不同语言中完全相同,年龄分类是否存在显著的跨语言差异?
主要发现
- 多语言个体公平性在很大程度上得到满足,语义等价的文本在不同语言中与同一图像保持一致的对齐。
- 存在严重的多语言准确率差异:在婴儿年龄分类任务中,英语的准确率为 5.8%,而德语为 89.4%,日语为 91.6%。
- 在年龄分类中,跨语言的性别差距显著,男性与女性群体在不同语言中表现出明显差异。
- 模型对高资源语言(如德语和日语)表现出强烈偏见,而在某些人口类别中对低资源语言(如法语)表现较差。
- 群体公平性度量对视觉表征的选择高度敏感,表明模型设计选择会影响公平性结果。
- 即使文本提示中的数值年龄在不同语言中完全相同,准确率在不同语言间仍存在显著差异,表明模型中存在语言与文化编码偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。