[论文解读] Tackling Bias in Pre-trained Language Models: Current Trends and Under-represented Societies
本文对预训练语言模型中的偏见进行了全面综述,强调了当前缓解技术在应对代表性不足及原住民社会时的局限性。文章主张采用情境化、基于社区的解决方案,以新西兰毛利社区为案例研究,而非通用的‘一刀切’方法,强调在人工智能开发中需要包容性的数据治理和跨文化协作。
The benefits and capabilities of pre-trained language models (LLMs) in current and future innovations are vital to any society. However, introducing and using LLMs comes with biases and discrimination, resulting in concerns about equality, diversity and fairness, and must be addressed. While understanding and acknowledging bias in LLMs and developing mitigation strategies are crucial, the generalised assumptions towards societal needs can result in disadvantages towards under-represented societies and indigenous populations. Furthermore, the ongoing changes to actual and proposed amendments to regulations and laws worldwide also impact research capabilities in tackling the bias problem. This research presents a comprehensive survey synthesising the current trends and limitations in techniques used for identifying and mitigating bias in LLMs, where the overview of methods for tackling bias are grouped into metrics, benchmark datasets, and mitigation strategies. The importance and novelty of this survey are that it explores the perspective of under-represented societies. We argue that current practices tackling the bias problem cannot simply be 'plugged in' to address the needs of under-represented societies. We use examples from New Zealand to present requirements for adopting existing techniques to under-represented societies.
研究动机与目标
- 识别当前预训练语言模型中偏见检测与缓解技术在应用于代表性不足及原住民社区时的局限性。
- 突出说明以资源丰富国家为中心的通用化偏见缓解方法在应对边缘化群体独特社会文化与语言需求方面的失败。
- 探讨不断演变的政府监管与法律框架对偏见研究及人工智能公平性的影响。
- 倡导将社区纳入循环的开发方法与数据主权模式,以确保人工智能开发中公平参与与利益共享。
- 提出从事后去偏见转向主动、包容性设计,将公平性从模型开发初期即嵌入其中。
提出的方法
- 系统性地将现有偏见缓解技术划分为三大支柱:偏见度量指标、基准数据集与缓解策略。
- 通过代表性公平性、群体公平性与刻板印象偏见等指标分析当前的偏见检测方法,强调其在跨文化语境中的局限性。
- 评估了如 HolisticBias 与 WinoQueer 等基准数据集,这些数据集由边缘化社区共同创建,以提升代表性准确性。
- 提出一种混合方法,结合大语言模型生成的刻板印象与社区参与,以扩大覆盖范围并减少偏见检测中的盲点。
- 强调自动化、多重视角偏见测量的重要性,以减少对主观人工标注的依赖,并降低标注者偏见。
- 建议整合实时监控系统与定期模型审计,以在部署后检测新兴偏见,特别是在动态社会语境中。

实验结果
研究问题
- RQ1当前预训练语言模型中的偏见检测与缓解技术在多大程度上无法满足代表性不足及原住民社会的需求?
- RQ2哪些关键的社会文化与语言挑战限制了现有偏见缓解方法向边缘化社区的可迁移性?
- RQ3基于社区的、社区主导的数据治理模式在提升大语言模型的公平性与代表性方面能发挥多大作用?
- RQ4像 GPT-4 和 Llama 2 这类近期的大语言模型在多大程度上能内在减少偏见?若被误用,可能带来哪些风险?
- RQ5不断演变的政府监管与法律框架如何影响多样社会中公平人工智能系统的开发与部署?
主要发现
- 当前的偏见缓解技术主要聚焦于二元性别分类与美国等资源丰富国家,忽视了交叉性与文化特定的偏见。
- 由边缘化社区共同创建的基准数据集如 HolisticBias 与 WinoQueer,揭示了传统方法无法检测到的刻板印象,凸显了社区参与的价值。
- 结合大语言模型生成的刻板印象与社区验证的混合方法,扩大了刻板印象的覆盖范围,并揭示了单一方法难以发现的独特偏见。
- 对人工判断的依赖引入了主观性与潜在的个人偏见,凸显了开发自动化、多重视角评估框架的必要性。
- 近期模型如 GPT-4 在许多刻板印象话题上表现出更低的偏见,但其精确的指令遵循能力也增加了恶意操控的风险。
- 全球范围内的持续监管变革要求研究实践具备适应性,而包容性治理模式,整合民间社会、政策制定者与受影响社区,对于实现人工智能的可持续公平至关重要。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。