[论文解读] Queer People are People First: Deconstructing Sexual Identity Stereotypes in Large Language Models
本文通过测量生成文本中的尊重度评分,调查并缓解了大型语言模型(LLMs)对LGBTQ+个体的表征偏见。通过使用思维链提示和SHAP分析,作者识别出与LGBTQ+身份相关的低尊重度词汇,并采用事后文本到文本的风格迁移方法,在保持上下文不变的同时提高尊重度评分,展示了一种有前景的、用于肯定LLM输出的去偏方法。
Large Language Models (LLMs) are trained primarily on minimally processed web text, which exhibits the same wide range of social biases held by the humans who created that content. Consequently, text generated by LLMs can inadvertently perpetuate stereotypes towards marginalized groups, like the LGBTQIA+ community. In this paper, we perform a comparative study of how LLMs generate text describing people with different sexual identities. Analyzing bias in the text generated by an LLM using regard score shows measurable bias against queer people. We then show that a post-hoc method based on chain-of-thought prompting using SHAP analysis can increase the regard of the sentence, representing a promising approach towards debiasing the output of LLMs in this setting.
研究动机与目标
- 调查预训练LLM是否在生成的文本中持续存在可测量、可量化的对LGBTQ+个体的偏见。
- 使用反映边缘群体社会认知的尊重度评分指标,量化表征偏见。
- 开发并评估一种事后去偏方法,以在保持上下文完整性的前提下,提升LGBTQ+-标识个体的尊重度评分。
- 证明LLM输出中低尊重度的语言模式可借助可解释AI技术系统性地识别并重写。
提出的方法
- 使用WikiBio数据集中性别中立的传记作为上下文丰富、匿名化的提示,以最小化性别效应的干扰。
- 在提示前添加表示性取向的关键词(例如,'straight'、'gay'、'lesbian'),以诱发与身份相关的LLM输出。
- 采用Sheng等人(2019)提出的尊重度评分,量化生成描述中对个体的社会认知。
- 对尊重度分类器应用SHAP分析,识别出导致LGBTQ+身份输出中尊重度评分降低的具体词汇。
- 提出一种事后文本到文本的风格迁移方法,通过替换具有偏见暗示的词汇,同时保持语义含义,重写低尊重度句子。
- 使用思维链提示引导LLM识别并替换低尊重度词汇,从而在不改变核心上下文的前提下提高尊重度评分。
实验结果
研究问题
- RQ1RQ1:预训练LLM是否在其文本生成中持续存在可测量、可量化的对LGBTQ+人群的偏见?
- RQ2RQ2:能否通过一种事后去偏方法,在保持上下文信息的同时减轻LLM输出中的此类偏见?
- RQ3RQ3:SHAP与思维链提示技术在多大程度上能够识别并纠正LLM输出中的低尊重度语言模式?
主要发现
- LLM对被标识为LGBTQ+的个体生成的尊重度评分显著低于对被标识为异性恋的个体,表明存在可测量的表征偏见。
- 使用表示LGBTQ+身份的关键词导致输出更强调挣扎与慈善,而异性恋身份个体则更多被描述为职业成功。
- SHAP分析成功识别出与模型输出中尊重度评分降低相关的具体低尊重度词汇,如'gay'。
- 思维链提示使LLM能够识别并替换低尊重度词汇,从而在不改变句子核心语义内容的前提下提高尊重度评分。
- 事后去偏方法在保持上下文信息的同时提升了尊重度评分,证明了针对性、上下文保持型缓解策略的可行性。
- 结果表明,即使在性别中立且事实等同的传记上下文中,LLM输出中对LGBTQ+个体的社会认知仍系统性地偏低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。