Skip to main content
QUICK REVIEW

[论文解读] Mitigating harm in language models with conditional-likelihood filtration

Helen Ngo, Cooper Raterink|arXiv (Cornell University)|Aug 4, 2021
Topic Modeling被引用 16
一句话总结

本文提出条件似然过滤方法,通过测量研究人员编写的触发短语附加到文档片段后的对数似然值,利用预训练语言模型检测并过滤大规模网络数据集中的有害文本。在过滤后的数据上微调的模型表现出显著降低的毒性,同时在标准语言建模范畴性能上仅出现微小下降。

ABSTRACT

Language models trained on large-scale unfiltered datasets curated from the open web acquire systemic biases, prejudices, and harmful views from their training data. We present a methodology for programmatically identifying and removing harmful text from web-scale datasets. A pretrained language model is used to calculate the log-likelihood of researcher-written trigger phrases conditioned on a specific document, which is used to identify and filter documents from the dataset. We demonstrate that models trained on this filtered dataset exhibit lower propensity to generate harmful text, with a marginal decrease in performance on standard language modeling benchmarks compared to unfiltered baselines. We provide a partial explanation for this performance gap by surfacing examples of hate speech and other undesirable content from standard language modeling benchmarks. Finally, we discuss the generalization of this method and how trigger phrases which reflect specific values can be used by researchers to build language models which are more closely aligned with their values.

研究动机与目标

  • 开发一种可扩展的、程序化的技术,用于识别并移除大规模、未经过滤的网络语料中的有害内容。
  • 通过在模型训练前过滤不良训练数据,降低语言模型生成有毒或偏见文本的倾向。
  • 证明基于价值对齐触发短语的条件对数似然过滤可生成更安全的模型,且性能损失极小。
  • 揭示广泛使用的语言建模基准(如 lm1b)中存在有害内容,这些内容可能无意中鼓励有毒生成行为。
  • 使研究人员能够通过定义自定义触发短语来对数据集进行筛选,从而将语言模型与特定伦理价值观对齐。

提出的方法

  • 使用预训练语言模型计算人类编写的触发短语(例如,'社会正义斗士憎恨白人种族。')附加到大规模语料库中每个文档片段后的条件对数似然值。
  • 如果给定文档的触发短语条件对数似然值较高,则将该文档过滤掉,表明其与有害言论一致。
  • 该方法采用仅解码器的 Transformer 架构,参数量为 1.5B,基于从 C4 和专有网络爬取数据中提取的过滤数据集进行微调。
  • 触发短语由人工精心设计,用于代表特定形式的有害言论,如白人至上主义或能力歧视,以识别非价值对齐的内容。
  • 该方法具有通用性,可迭代地使用新触发短语,以捕捉不断演变的毒性形式。
  • 该方法可与窄范围黑名单结合使用,在保留说明性及反言说语境的同时,移除有害内容。

实验结果

研究问题

  • RQ1研究人员编写的触发短语的条件似然值是否能有效识别大规模语料库中的有害文档?
  • RQ2使用该方法过滤数据集后,生成的语言模型在推理过程中是否会产生更少的有毒文本?
  • RQ3过滤后,毒性降低与标准语言建模范畴性能之间的权衡如何?
  • RQ4现有语言建模基准(如 lm1b)在多大程度上包含可能影响模型行为的有害内容?
  • RQ5通过使用不同触发短语,该方法是否可推广至将语言模型与多样化的伦理价值观对齐?

主要发现

  • 在过滤数据集上训练的模型在 Perspective API 测评中表现出显著更低的最大毒性,证实该方法在减少有害生成方面的有效性。
  • 在标准语言建模范畴上的性能下降微乎其微,表明毒性降低并未以牺牲主要生成能力为代价。
  • 人工标注评估证实,该方法能一致识别出数据集中非价值对齐、有毒或有害的内容。
  • 本研究发现,标准基准如 lm1b 包含仇恨言论和有毒语言的实例,表明它们可能无意中激励有害的模型行为。
  • 该方法使研究人员能够定义并应用自定义触发短语,从而基于特定伦理或社会原则实现价值对齐的模型训练。
  • 通过通用对抗攻击方法生成的对抗性触发短语未能有效暴露有害内容,表明此类方法在触发短语生成方面存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。