Skip to main content
QUICK REVIEW

[论文解读] Can Model Compression Improve NLP Fairness

Guangxuan Xu, Qingyuan Hu|arXiv (Cornell University)|Jan 21, 2022
Topic Modeling被引用 15
一句话总结

本文研究了模型压缩——特别是知识蒸馏和剪枝——对生成式语言模型公平性的影响。研究发现,蒸馏能一致地降低 GPT-2 和 Blenderbot 模型的毒性与偏见,表明压缩可能作为一种正则化技术,提升公平性,为构建更安全的 NLP 系统提供了新途径。

ABSTRACT

Model compression techniques are receiving increasing attention; however, the effect of compression on model fairness is still under explored. This is the first paper to examine the effect of distillation and pruning on the toxicity and bias of generative language models. We test Knowledge Distillation and Pruning methods on the GPT2 model and found a consistent pattern of toxicity and bias reduction after model distillation; this result can be potentially interpreted by existing line of research which describes model compression as a regularization technique; our work not only serves as a reference for safe deployment of compressed models, but also extends the discussion of "compression as regularization" into the setting of neural LMs, and hints at the possibility of using compression to develop fairer models.

研究动机与目标

  • 研究模型压缩技术(知识蒸馏与剪枝)对生成式语言模型公平性度量(如毒性与偏见)的影响。
  • 确定观察到的公平性提升是源于记忆减少,还是压缩模型中的结构简化。
  • 探索模型压缩是否可作为正则化机制,提升公平性,将“压缩即正则化”假说扩展至神经语言模型。
  • 评估蒸馏是否驱动压缩模型中观察到的公平性提升,而非模型大小本身。
  • 基于压缩技术,识别 NLP 中潜在的通用公平性提升方法,尤其适用于资源受限设备的部署。

提出的方法

  • 对较小的学生模型应用知识蒸馏,使用更大的教师模型(GPT-2 和 Blenderbot 3B)进行微调,以在减小模型规模的同时传递知识。
  • 采用剪枝技术减少模型参数,评估其对公平性度量的影响,但结果不如蒸馏明确。
  • 使用标准化基准评估模型公平性:RealToxicityPrompts 用于毒性,Winogrande/StereoSet 用于性别与社会偏见。
  • 通过消融研究隔离蒸馏的影响,排除模型大小减少的干扰,确认是蒸馏本身而非仅大小导致公平性提升。
  • 测量各模型的困惑度(PPL)以评估生成质量,并分析性能变化是否与公平性变化相关。
  • 采用多种提示采样策略(有毒、安全、随机)和数据集(RealToxicityPrompts 和 TCCC),测试公平性趋势在不同输入和数据分布下的鲁棒性。

实验结果

研究问题

  • RQ1与完整尺寸模型相比,知识蒸馏是否能降低生成式语言模型的毒性与偏见?
  • RQ2观察到的公平性提升是源于压缩本身,还是特定于蒸馏过程,且独立于模型大小?
  • RQ3模型压缩能否被视为一种正则化形式,以减少神经语言模型中的毒性与偏见?
  • RQ4不同压缩技术(蒸馏 vs. 剪枝)如何影响公平性度量?为何蒸馏可能表现出更强效果?
  • RQ5公平性提升在分布外数据(如未在训练中见过的 TCCC 数据集)上能持续多大程度?

主要发现

  • 知识蒸馏在多个数据集和采样策略下一致降低模型毒性,包括 GPT-2 模型在训练中未见过的 TCCC 数据集。
  • 根据 Winogrande 基准测量的性别偏见随蒸馏强度增加而降低,表明压缩模型中偏见呈单调递减趋势。
  • 根据 Stereoset 基准测量的社会偏见无明显趋势,基本保持平坦,表明该度量对检测偏见变化可能缺乏敏感性或可靠性。
  • 毒性与偏见的降低并非仅因困惑度降低,因为即使困惑度未匹配,蒸馏仍能提升公平性,表明存在结构或归纳偏置效应。
  • 蒸馏模型(如 Distilled-400M Blenderbot)的毒性低于原始 3B Blenderbot 模型,证实是蒸馏过程而非模型大小驱动了公平性提升。
  • 观察到的公平性提升无法通过训练数据的简单记忆来解释,因为该模式在未见数据上依然存在,表明蒸馏带来了更深层次的正则化效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。