[论文解读] KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application
KoSBi 是一个包含 34,214 个上下文-句子对的韩语社会偏见数据集,针对 15 个类别中的 72 个人口群体,通过大语言模型生成数据并经人工标注构建。采用在 KoSBi 上微调的分类器进行基于过滤的审核方法,使 HyperCLOVA(30B 和 82B)及 GPT-3 的大语言模型输出中的社会偏见平均降低了 16.47%,证明了在文化与语言特定语境下有效缓解偏见的方法。
Large language models (LLMs) learn not only natural text generation abilities but also social biases against different demographic groups from real-world data. This poses a critical risk when deploying LLM-based applications. Existing research and resources are not readily applicable in South Korea due to the differences in language and culture, both of which significantly affect the biases and targeted demographic groups. This limitation requires localized social bias datasets to ensure the safe and effective deployment of LLMs. To this end, we present KO SB I, a new social bias dataset of 34k pairs of contexts and sentences in Korean covering 72 demographic groups in 15 categories. We find that through filtering-based moderation, social biases in generated content can be reduced by 16.47%p on average for HyperCLOVA (30B and 82B), and GPT-3.
研究动机与目标
- 为解决韩国缺乏文化与语言特定的社会偏见数据集的问题,现有数据集在人口群体范围和文化相关性方面均存在局限。
- 开发一个全面的本地化资源,用于检测和缓解韩语大语言模型(LLMs)中的社会偏见。
- 通过基于精选、人工标注数据集训练的过滤式审核系统,实现在大语言模型生成内容中的有效偏见缓解。
- 通过涵盖婚姻状况和地域出身等代表性不足且语境特定的人口群体,确保大语言模型应用在韩国的安全部署。
提出的方法
- 利用 HyperCLOVA 通过上下文 few-shot 提示生成 34,214 个上下文-句子对,针对 15 个类别中的 72 个人口群体。
- 收集并整理数据,聚焦于包括刻板印象、偏见和歧视在内的社会偏见,明确与《世界人权宣言》及韩国国家人权委员会准则保持一致。
- 利用众包工作者对每个上下文和句子进行标注,判断其为安全或不安全,不安全样本进一步依据 Fiske 分类法标注为(刻板印象、偏见、歧视、其他)。
- 在 KoSBi 数据集上训练安全句子分类器,以在推理阶段识别偏见内容。
- 实施基于过滤的审核策略(拒绝采样),即生成多个候选回复,并根据分类器输出选择最安全的一个。
- 通过在扩充的 1,746 个上下文测试集上进行人工评估,对比 GPT-3 和 HyperCLOVA 模型在过滤与未过滤生成结果之间的表现。

实验结果
研究问题
- RQ1针对韩语大语言模型的大规模、文化特定的社会偏见数据集是否能有效降低生成内容中的偏见?
- RQ2基于 KoSBi 训练的分类器进行过滤式审核,在韩语大语言模型中对多样化人口群体的社会偏见降低程度如何?
- RQ3当使用 KoSBi 作为微调与过滤资源时,不同大语言模型架构(如 GPT-3、HyperCLOVA 30B/82B)的偏见缓解性能表现有何差异?
- RQ4是否包含代表性不足的人口群体(如地域出身和婚姻状况)能提升韩国大语言模型输出的公平性与安全性?
- RQ5在流畅性、连贯性和相关性方面,人工评估显示过滤与未过滤的大语言模型回复表现有何差异?
主要发现
- 基于 KoSBi 训练的分类器进行过滤式审核,使 HyperCLOVA(82B)、HyperCLOVA(30B)和 GPT-3 的大语言模型生成内容中的社会偏见平均降低了 16.47%。
- 该过滤方法保持了较高的流畅性与连贯性,GPT-3 的语法正确性仅下降 2.0%,理解度下降 2.0%。
- 人工评估显示,该方法在全部 15 个人口类别中均提升了安全性,其中 'LGBTQ+' 和 '国内地域出身' 群体的安全性提升最为显著。
- 表现最佳的分类器 KcELECTRA 在测试集上识别不安全句子的准确率达到 92.5%,表明其对未见数据具有良好的泛化能力。
- 该方法保持了上下文相关性与响应质量,仅在连贯性与相关性方面出现轻微下降,表明安全与实用性之间的权衡极小。
- 该数据集涵盖 15 个类别中的 72 个人口群体,包括 '庆尚' 和 '全罗' 等具有地域特异性的身份,使韩国范围内的偏见缓解更加全面与公平。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。