Skip to main content
QUICK REVIEW

[论文解读] COLD: A Benchmark for Chinese Offensive Language Detection

Jiawen Deng, Jingyan Zhou|arXiv (Cornell University)|Jan 16, 2022
Hate Speech and Cyberbullying Detection被引用 7
一句话总结

本文提出COLD,一个用于中文攻击性语言检测的基准,包含COLDataset(37,480条标注评论)和COLDetector——一个在该数据集上微调的基于BERT的分类器。该基准揭示,无论是攻击性还是非攻击性输入——尤其是反偏见和群体针对性提示——都可能在中文大模型中触发攻击性生成,凸显了部署过程中存在的关键安全风险。

ABSTRACT

Offensive language detection is increasingly crucial for maintaining a civilized social media platform and deploying pre-trained language models. However, this task in Chinese is still under exploration due to the scarcity of reliable datasets. To this end, we propose a benchmark --COLD for Chinese offensive language analysis, including a Chinese Offensive Language Dataset --COLDATASET and a baseline detector --COLDETECTOR which is trained on the dataset. We show that the COLD benchmark contributes to Chinese offensive language detection which is challenging for existing resources. We then deploy the COLDETECTOR and conduct detailed analyses on popular Chinese pre-trained language models. We first analyze the offensiveness of existing generative models and show that these models inevitably expose varying degrees of offensive issues. Furthermore, we investigate the factors that influence the offensive generations, and we find that anti-bias contents and keywords referring to certain groups or revealing negative attitudes trigger offensive outputs easier.

研究动机与目标

  • 为解决中文攻击性语言检测中缺乏可靠数据集和检测器的问题。
  • 评估主流中文生成式语言模型的攻击性,并识别其攻击性输出的触发因素。
  • 探究非攻击性输入(如反偏见提示)是否仍可能引发攻击性生成。
  • 为未来中文自然语言处理中攻击性语言研究提供标准化基准。
  • 提高对模型在看似中性或合乎伦理内容提示下被忽略的安全风险的认识。

提出的方法

  • 通过半自动与人工标注的方式,对37,480条中文社交媒体评论进行二元攻击性标签标注,构建COLDataset。
  • 在测试集中采用细粒度标注方案,将攻击性内容划分为:针对个人的攻击、针对群体的攻击、反偏见内容以及其他非攻击性类型。
  • COLDetector是基于BERT-base-Chinese的模型,在COLDataset上进行微调,用作攻击性语言检测的基线模型。
  • 利用该基准评估三种主流中文生成模型(CDialGPT、CPM和EVA)的攻击性生成风险。
  • 系统性地改变输入提示,分析触发因素,包括反偏见语言、群体特定关键词和负面态度词汇。
  • 通过统计分析比较不同输入类型下的攻击性输出率,识别高风险触发因素。

实验结果

研究问题

  • RQ1当使用非攻击性或反偏见内容作为提示时,中文生成式语言模型在多大程度上会产生攻击性输出?
  • RQ2哪些输入类型(如群体针对性关键词或负面态度词汇)最可能触发攻击性生成?
  • RQ3COLDetector在中文攻击性语言检测任务上相较于现有方法表现如何?
  • RQ4像COLD这样的基准是否有助于在部署前识别并缓解中文大模型中的安全风险?
  • RQ5为何某些非攻击性输入会以与明确攻击性输入相当的频率触发攻击性输出?

主要发现

  • 攻击性和非攻击性输入均可能触发中文大模型的攻击性生成,其中非攻击性输入(尤其是反偏见提示)的攻击性输出率与明确攻击性输入相当。
  • 反偏见内容(旨在促进公平)更可能触发攻击性输出,原因在于其内嵌的群体特定关键词和负面态度词汇。
  • COLDetector在COLDataset上表现优异,在基于该基准微调后,优于现有方法。
  • 该基准揭示当前数据集中未充分捕捉上下文信息,提示未来需开展对话级攻击性语言检测研究。
  • 基线模型性能受限于数据覆盖范围和训练技术,表明通过更丰富、更细粒度的标注可进一步提升性能。
  • 本研究强调了在看似伦理中性或积极的输入中可能被忽视的安全风险,呼吁在模型评估中采用更广泛的检测标准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。