Skip to main content
QUICK REVIEW

[论文解读] Detoxifying Language Models Risks Marginalizing Minority Voices

Albert Xu, Eshaan Pathak|arXiv (Cornell University)|Apr 13, 2021
Topic Modeling参考文献 25被引用 11
一句话总结

本文表明,旨在减少语言模型生成有害内容的去毒化技术,会无意中损害公平性,导致对非洲裔美国人英语(AAE)和少数群体身份指涉(MIM)的困惑度显著上升,且生成质量下降。其核心问题源于毒性数据集中的虚假相关性:由于标注和采样偏差,AAE和MIM在毒性标签中被过度代表,导致去毒化方法错误地抑制了这些语言特征。

ABSTRACT

Language models (LMs) must be both safe and equitable to be responsibly deployed in practice. With safety in mind, numerous detoxification techniques (e.g., Dathathri et al. 2020; Krause et al. 2020) have been proposed to mitigate toxic LM generations. In this work, we show that current detoxification techniques hurt equity: they decrease the utility of LMs on language used by marginalized groups (e.g., African-American English and minority identity mentions). In particular, we perform automatic and human evaluations of text generation quality when LMs are conditioned on inputs with different dialects and group identifiers. We find that detoxification makes LMs more brittle to distribution shift, especially on language used by marginalized groups. We identify that these failures stem from detoxification methods exploiting spurious correlations in toxicity datasets. Overall, our results highlight the tension between the controllability and distributional robustness of LMs.

研究动机与目标

  • 调查语言模型的去毒化技术是否对边缘化语言变体(如非洲裔美国人英语(AAE)和少数群体身份指涉(MIM))的性能产生负面影响。
  • 检验观察到的性能下降是否源于毒性数据集中将AAE和MIM与毒性错误关联的虚假相关性。
  • 评估去毒化强度对不同方言和身份标记下模型实用性的影。
  • 突出展示在现实世界NLP部署中,有偏见的去毒化所引入的表征性伤害和污名化风险。

提出的方法

  • 本研究采用四种最先进的去毒化技术:领域自适应预训练(DAPT)、即插即用语言模型(PPLM)、GeDi,以及使用毒性分类器进行输出过滤。
  • 所有方法均应用于GPT-2 medium模型,在过滤掉低标注一致性样本后,基于Jigsaw Civil Comments数据集进行微调。
  • 通过测量包含AAE或MIM的提示与白人对齐英语(WAE)的困惑度,比较不同去毒化强度水平下的表现。
  • 通过众包工作者进行人工评估,衡量在WAE和AAE提示下生成文本的流畅性、风格一致性和主题一致性。
  • 分析发现,毒性数据集中存在AAE/MIM与毒性标签之间的虚假相关性,这是由于标注偏差(将AAE错误标记为有毒)和采样偏差(有毒评论常针对边缘化群体)所致。
  • 通过调整超参数(如GeDi中的ω),表明增强去毒化强度会加剧AAE和MIM上的性能下降。

实验结果

研究问题

  • RQ1语言模型的去毒化是否导致对非洲裔美国人英语(AAE)和少数群体身份指涉(MIM)的困惑度增加,相较于白人对齐英语(WAE)更为显著?
  • RQ2增强去毒化强度在多大程度上加剧了AAE和MIM上的性能下降?
  • RQ3毒性数据集中存在的虚假相关性在多大程度上导致去毒化方法抑制了AAE和MIM?
  • RQ4当生成文本基于AAE提示而非WAE提示时,去毒化模型在人工评估中的表现如何?
  • RQ5部署去毒化模型并因此边缘化少数群体语言身份,会带来哪些表征性和社会性伤害?

主要发现

  • 去毒化技术显著提高了对AAE和MIM文本的困惑度,基线模型在AAE上的困惑度已约为WAE的三倍。
  • 当进行强去毒化处理时(如GeDi中ω值较高),AAE上的困惑度上升至WAE的近400倍,表明其可用性严重下降。
  • 人工评估显示,去毒化模型在生成AAE提示文本时,无法保持流畅性、风格一致性和主题连贯性,而对WAE提示则表现良好。
  • 性能下降并非局限于单一去毒化方法,而是在DAPT、PPLM、GeDi和过滤方法中均一致观察到,表明这是根植于有偏数据的系统性问题。
  • 毒性数据集中存在的虚假相关性——由标注偏差(错误地将AAE标记为有毒)和采样偏差(有毒评论常针对边缘化群体)引起——导致去毒化模型避免使用AAE和MIM。
  • 增强去毒化强度会放大偏差,证实该问题并非副作用,而是当前去毒化流程中的结构性缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。