Skip to main content
QUICK REVIEW

[论文解读] Debiasing isn't enough! -- On the Effectiveness of Debiasing MLMs and their Social Biases in Downstream Tasks

Masahiro Kaneko, Danushka Bollegala|arXiv (Cornell University)|Oct 6, 2022
Topic Modeling被引用 9
一句话总结

本文研究了掩码语言模型(MLMs)中内在偏见与外在偏见评估之间的脱节问题,发现二者之间仅存在微弱的相关性。即使经过去偏处理,MLMs 在微调过程中仍会因训练实例和标签中的偏见而重新习得社会偏见,从而削弱了内在评估方法在部署决策中的可靠性。

ABSTRACT

We study the relationship between task-agnostic intrinsic and task-specific extrinsic social bias evaluation measures for Masked Language Models (MLMs), and find that there exists only a weak correlation between these two types of evaluation measures. Moreover, we find that MLMs debiased using different methods still re-learn social biases during fine-tuning on downstream tasks. We identify the social biases in both training instances as well as their assigned labels as reasons for the discrepancy between intrinsic and extrinsic bias evaluation measurements. Overall, our findings highlight the limitations of existing MLM bias evaluation measures and raise concerns on the deployment of MLMs in downstream applications using those measures.

研究动机与目标

  • 考察任务无关的内在偏见评估与任务相关的外在偏见评估在 MLMs 中的关系。
  • 探究在下游任务上微调后,去偏的 MLMs 是否仍保持无偏状态。
  • 识别内在与外在偏见度量之间差异的主要根源。
  • 挑战仅凭内在偏见评估即可确定模型是否适合部署的假设。
  • 揭示当前使用 MLMs 的 NLP 系统中偏见评估实践的局限性。

提出的方法

  • 使用三种内在偏见评估度量(SSS、CPS 和 AULA)评估了 7 个预训练 MLMs 及其去偏变体。
  • 对 MLMs 应用了三种不同的去偏方法,以评估其在各类评估中的有效性。
  • 在三个数据集(BiasBios、STS-bias 和 NLI-bias)上进行下游微调,以评估外在偏见行为。
  • 在微调前后计算内在与外在偏见得分之间的 Kendall’s tau 相关系数。
  • 分析训练实例和标签,以识别微调过程中偏见重新编码的来源。
  • 使用统计显著性检验(p < 0.05)评估不同评估类型之间观察到的相关性的可靠性。

实验结果

研究问题

  • RQ1MLMs 中内在与外在偏见评估度量之间是否存在强相关性?
  • RQ2在下游任务上微调后,去偏的 MLMs 是否仍保持其去偏状态?
  • RQ3在下游任务微调过程中,偏见重新编码的主要来源是什么?
  • RQ4仅凭内在偏见评估是否足以信任其判断模型是否适合部署?
  • RQ5不同去偏方法在内在与外在偏见评估框架中的表现如何?

主要发现

  • 在所有测试的 MLMs 和数据集中,内在与外在偏见评估度量之间仅存在微弱且不一致的相关性。
  • 在 NLI-bias 上,微调后内在与外在度量之间的相关性下降(从 0.22 降至 0.21),其他任务的相关性也保持较低水平。
  • 微调后唯一具有统计显著性的相关性是 STS-bias 与 SSS 之间的(τ = 0.38),该值低于微调前的 0.53。
  • 去偏的 MLMs 在微调过程中因训练数据中的实例相关偏见和标签分配中的标签相关偏见而重新习得社会偏见。
  • 即使经过去偏处理,内在与外在偏见评估之间的差异依然存在,表明内在度量不足以用于部署评估。
  • 本研究发现,下游任务中的数据内容和标签分配均会导致偏见重新编码,从而挑战了孤立内在评估的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。