[论文解读] RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models
本文提出了 RealToxicityPrompts,一个包含 100K 个样本的语料库,该语料库源自网络文本,包含自然发生的、句子级别的提示,每个提示均配有 PERSPECTIVE API 的毒性评分。研究发现,即使非毒性提示也会在 GPT-2 等预训练语言模型中引发高度毒性的生成结果,揭示了持续存在的‘神经毒性退化’现象。尽管数据和计算资源密集型的方法(如在非毒性数据上微调)可减轻但无法完全消除毒性,作者还发现预训练语料库(如 OpenWebText 和 OpenAI WebText)中存在大量毒性内容,凸显了在语言模型训练中改进数据筛选与整理的迫切需求。
Pretrained neural language models (LMs) are prone to generating racist, sexist, or otherwise toxic language which hinders their safe deployment. We investigate the extent to which pretrained LMs can be prompted to generate toxic language, and the effectiveness of controllable text generation algorithms at preventing such toxic degeneration. We create and release RealToxicityPrompts, a dataset of 100K naturally occurring, sentence-level prompts derived from a large corpus of English web text, paired with toxicity scores from a widely-used toxicity classifier. Using RealToxicityPrompts, we find that pretrained LMs can degenerate into toxic text even from seemingly innocuous prompts. We empirically assess several controllable generation methods, and find that while data- or compute-intensive methods (e.g., adaptive pretraining on non-toxic data) are more effective at steering away from toxicity than simpler solutions (e.g., banning "bad" words), no current method is failsafe against neural toxic degeneration. To pinpoint the potential cause of such persistent toxic degeneration, we analyze two web text corpora used to pretrain several LMs (including GPT-2; Radford et. al, 2019), and find a significant amount of offensive, factually unreliable, and otherwise toxic content. Our work provides a test bed for evaluating toxic generations by LMs and stresses the need for better data selection processes for pretraining.
研究动机与目标
- 系统评估预训练语言模型中毒性退化的风险。
- 识别看似非毒性的提示是否可能触发高度毒性的生成结果。
- 评估可控生成方法在防止有毒输出方面的有效性。
- 分析 OpenWebText 和 OpenAI WebText 等主要预训练语料库中的毒性水平。
- 强调在语言模型预训练中改进数据选择与整理的紧迫需求。
提出的方法
- 构建 RealToxicityPrompts:从英文网络文本中提取 100K 个句子级别的提示,经人工筛选确保其非毒性,由 PERSPECTIVE API 评估。
- 使用 PERSPECTIVE API 为每个提示分配毒性评分,并将评分 ≥0.5 的提示标记为有毒。
- 评估多种可控生成方法(如毒性控制标记、脏话过滤、在非毒性数据上微调)在防止有毒生成方面的表现。
- 利用 PERSPECTIVE API 对 OpenWebText 语料库(OWTC)和 OpenAI WebText(OPENAI-WT)进行大规模毒性分析,涵盖多个毒性标签。
- 使用局部敏感哈希(LSH)和杰卡德距离估算 OWTC 与 OPENAI-WT 之间的重叠程度。
- 分析与有毒文档相关的子版块和域名,以追踪有害内容的来源。
实验结果
研究问题
- RQ1即使使用 PERSPECTIVE API 标记为非毒性的提示(TOXICITY < 0.5),预训练语言模型是否仍可能生成高度有毒的文本?
- RQ2各种可控生成技术(如过滤、微调)在防止毒性退化方面的有效性如何?
- RQ3在广泛使用的预训练语料库(如 OpenWebText 和 OpenAI WebText)中,毒性内容的占比有多大?
- RQ4被封禁或隔离的子版块在用于语言模型预训练的有毒网络语料库中是否被显著过度代表?
- RQ5提示中是否包含身份提及或脏话,是否与语言模型生成有毒内容的可能性增加相关?
主要发现
- 即使被 PERSPECTIVE API 标记为非毒性的提示(TOXICITY < 0.5),在 GPT-2 模型中仍会引发高度有毒的生成结果,其中一个提示的 46% 生成内容被分类为有毒。
- GPT-2 模型显示出提示毒性与生成毒性之间的强相关性(r = 0.43,p < 0.001),以及提示中的脏话与生成内容中脏话之间的相关性(r = 0.169,p < 0.001)。
- 提示中少数群体身份提及比多数群体提及更可能被复制到生成结果中(rmin. = 0.13 vs. rmaj. = 0.08,p < 0.001),表明存在偏见传播现象。
- OpenWebText 语料库(OWTC)和 OpenAI WebText(OPENAI-WT)中均含有大量毒性内容,OWTC 中有 5.5% 的文档被标记为 'IDENTITY ATTACK',5.5% 为 'THREAT'。
- 被封禁或隔离的子版块在 OWTC 的有毒子集中显著过度代表,其中 10% 的有毒文档源自此类社区。
- 尽管采用了先进缓解技术,没有任何方法能完全杜绝毒性——表现最佳的方法(如在非毒性数据上微调)在某些提示下仍会产生高度有毒的生成结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。