[论文解读] AI-generated faces influence gender stereotypes and racial homogenization
本文提出了 SDXL-Inc 和 SDXL-Div 兩種針對 Stable Diffusion XL 的新型去偏方法,有效降低了生成人臉中的種族與性別刻板印象。利用先進的面部分類器,作者量化了六種種族、兩種性別、五個年齡群組、32種職業以及八種特徵中的偏見,並證明其方法在提升代表性公平性與面部多樣性方面顯著優於先前方法,相關成果已公開於 GitHub 供大眾使用。
Text-to-image generative AI models such as Stable Diffusion are used daily by millions worldwide. However, the extent to which these models exhibit racial and gender stereotypes is not yet fully understood. Here, we document significant biases in Stable Diffusion across six races, two genders, 32 professions, and eight attributes. Additionally, we examine the degree to which Stable Diffusion depicts individuals of the same race as being similar to one another. This analysis reveals significant racial homogenization, e.g., depicting nearly all Middle Eastern men as bearded, brown-skinned, and wearing traditional attire. We then propose debiasing solutions that allow users to specify the desired distributions of race and gender when generating images while minimizing racial homogenization. Finally, using a preregistered survey experiment, we find evidence that being presented with inclusive AI-generated faces reduces people's racial and gender biases, while being presented with non-inclusive ones increases such biases, regardless of whether the images are labeled as AI-generated. Taken together, our findings emphasize the need to address biases and stereotypes in text-to-image models.
研究动机与目标
- 量化 Stable Diffusion XL 在多種人口統計類別下生成人臉時所呈現的種族與性別刻板印象。
- 開發並評估新型去偏解決方案,使其在促進公平代表性方面超越現有最先进方法。
- 分析 AI 生成圖像中不同種族與性別群組之間面部特徵同質化的程度。
- 提出開源且可部署的解決方案,以提升文本到圖像生成中的多樣性。
- 透過自動化、GPT-4 增強的提示調節,解決基於提示的去偏方法所存在的語言模糊性與不透明性等限制。
提出的方法
- 開發了三階段流程:使用 MTCNN 進行人臉檢測,透過 VGGFace ResNet-50 卷積神經網絡提取人臉嵌入,並使用帶 RBF 核的 SVM 進行種族、性別與年齡預測分類。
- 訓練完成的分類器達到了最先进性能,並用於量化 Stable Diffusion XL 在六種種族、兩種性別、五個年齡群組、32 種職業與八種特徵上的輸出偏見。
- SDXL-Inc 透過微調 Stable Diffusion XL,結合可學習提示與 CLIP 嵌入,對齊圖像與文字特徵,從而實現不同人口群組之間的平衡生成。
- SDXL-Div 透過在提示中注入隨機的種族與性別屬性(當未明確指定時)來提升面部多樣性,並使用 GPT-4 檢測與調節提示內容。
- 實施了 GPT-4 內循環系統,用於分析使用者提示,並注入遺漏的人口統計屬性(種族、性別),以確保代表性平衡。
- 使用作者分類器在從 Flickr-Faces-HQ 數據集精選的數據上重新訓練 ITI-GEN 模型,以確保訓練過程中性別與種族的代表性平衡。

实验结果
研究问题
- RQ1Stable Diffusion XL 生成的人臉在多種人口統計類別下,其種族與性別刻板印象的表現程度如何?
- RQ2分類器引導的提示工程與 GPT-4 內循環提示調節在減少文本到圖像生成中的代表性偏見方面有多麼有效?
- RQ3如 SDXL-Inc 與 SDXL-Div 之類的去偏方法能否超越現有最先进方法,在促進公平面部表徵方面表現更優?
- RQ4AI 生成的人臉在種族與性別群組內的面部特徵同質化程度如何?又該如何減輕此現象?
- RQ5透過大語言模型自動注入提示對生成圖像的公平性與多樣性有何影響?
主要发现
- 所提出的面部分類器在種族、性別與年齡預測上達到了最先进性能,從而實現對 Stable Diffusion XL 輸出偏見的精確量化。
- Stable Diffusion XL 展現出強烈的刻板印象,例如將大多數中東男性描繪為深色皮膚、留鬍鬚並佩戴傳統頭飾。
- SDXL-Inc 與 SDXL-Div 在促進所有六種種族與兩種性別之間的平衡代表性方面,顯著優於現有去偏方法。
- GPT-4 內循環系統成功將遺漏的人口統計屬性注入提示中,提升了公平性,且無需手動提示工程。
- 使用作者分類器重新訓練 ITI-GEN 後,模型在種族代表性上近乎均等,僅拉丁裔因與白人及中東群組面部特徵相似而略有偏差。
- 本研究的去偏解決方案與所有訓練數據均已透過 GitHub 倉庫公開,支援可重現性與社群採用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。