[论文解读] "Im not Racist but...": Discovering Bias in the Internal Knowledge of Large Language Models
本文提出一种基于提示、以知识图谱为驱动的方法,可自动发现并可视化大型语言模型(LLMs),如 GPT-3 内部知识中隐藏的刻板印象。通过动态生成与偏见相关的关联结构化表示,该方法识别出 LLM 在将国籍和社会群体与温暖度和能力感关联时存在的系统性差异,揭示了模型知识中根深蒂固的社会偏见,且无需依赖静态模板。
Large language models (LLMs) have garnered significant attention for their remarkable performance in a continuously expanding set of natural language processing tasks. However, these models have been shown to harbor inherent societal biases, or stereotypes, which can adversely affect their performance in their many downstream applications. In this paper, we introduce a novel, purely prompt-based approach to uncover hidden stereotypes within any arbitrary LLM. Our approach dynamically generates a knowledge representation of internal stereotypes, enabling the identification of biases encoded within the LLM's internal knowledge. By illuminating the biases present in LLMs and offering a systematic methodology for their analysis, our work contributes to advancing transparency and promoting fairness in natural language processing systems.
研究动机与目标
- 解决当前缺乏灵活、可扩展的 LLM 偏见检测方法的问题,这些方法不依赖于手工构建的模板。
- 通过提取并结构化社会群体与温暖度、能力感等评价性特质之间的关联,绘制 LLM 内嵌的刻板印象知识。
- 为任何 LLM 的内部知识库提供系统化、自动化的框架,以识别和可视化偏见,无论群体类型(如种族、性别、国籍)如何。
- 使从业者能够在部署前评估潜在偏见,从而提升 NLP 系统的透明度与公平性。
- 为未来分析内部刻板印象如何传播至下游模型行为奠定基础。
提出的方法
- 采用受 Cohen 等人(2023)启发的基于提示的方法,动态查询 LLM 以提取社会群体与评价性特质之间的关联。
- 利用一组初始的群体类别(如国籍、种族)生成提示,以诱发刻板印象关联,例如“来自 X 的人通常被认为……”或“X 常与……相关联”。
- 将模型的回复解析并结构化为知识图谱,其中节点代表群体和特质,边代表关联的强度或可能性。
- 对知识图谱进行分析,识别不同群体在温暖度和能力感等维度上被刻板表征的模式。
- 该方法应用于 GPT-3,实现了对不同国籍和社会类别间偏见分布的可视化与定量比较。
- 使用外部模型评估提取关联的语义合理性,尽管这可能引入辅助模型自身的潜在偏见。

实验结果
研究问题
- RQ1大型语言模型(如 GPT-3)的内部知识中编码了哪些类型的刻板印象和先入为主的观念?
- RQ2社会群体与温暖度、能力感等特质之间的关联在不同国籍和人口类别之间如何变化?
- RQ3在不依赖静态手工模板的前提下,基于提示的知识图谱生成方法在多大程度上能够揭示偏见?
- RQ4在不同群体中,与刻板印象相关的知识在能力相关特质与温暖相关特质之间的分布有何差异?
- RQ5该方法能否检测并可视化边缘化或历史上被污名化的群体在 LLM 知识中被表征时的系统性差异?
主要发现
- 该方法成功生成了知识图谱,揭示出如“俄罗斯人”等国籍被不成比例地与能力感关联,却与温暖度关联最弱,表明可能存在能力过度关联的偏见。
- 一种明显模式浮现:国籍更常与能力相关特质关联,而非温暖相关特质,表明刻板表征中存在系统性失衡。
- 模型对某些国籍与负面特质表现出强烈关联——例如,“中国人”在知识图谱中常与“刻板印象”或“负面”描述相关联,反映出训练数据中历史偏见的残留。
- 知识图谱显示,尽管大多数国家同时与温暖度和能力感相关联,但这些关联的强度存在显著差异,部分群体的得分明显更高或更低。
- 该方法识别出 LLM 的内部知识反映了训练数据中存在的社会偏见,例如某些国籍在高能力角色中被过度代表,而在温暖相关角色中被代表不足。
- 研究证实,模型知识库中存在刻板印象并不必然意味着其在生成过程中被使用,但此类知识的存在仍可能引发下游偏见传播的风险。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。