[论文解读] Unmasking the Mask -- Evaluating Social Biases in Masked Language Models
本文提出了全未掩码似然(AUL)和结合注意力权重的AUL(AULA),这是针对掩码语言模型(MLMs)的新颖偏差评估度量方法,通过同时预测所有未掩码标记,克服了先前方法在掩码选择偏差和预测准确性方面的局限,提升了评估的可靠性。AUL与AULA在检测社会偏差方面优于现有度量,尤其在性别、种族和职业刻板印象方面表现出更高的准确度,并与StereoSet和CrowS-Pairs数据集上的人工标注偏差评分具有更好的一致性。
Masked Language Models (MLMs) have shown superior performances in numerous downstream NLP tasks when used as text encoders. Unfortunately, MLMs also demonstrate significantly worrying levels of social biases. We show that the previously proposed evaluation metrics for quantifying the social biases in MLMs are problematic due to following reasons: (1) prediction accuracy of the masked tokens itself tend to be low in some MLMs, which raises questions regarding the reliability of the evaluation metrics that use the (pseudo) likelihood of the predicted tokens, and (2) the correlation between the prediction accuracy of the mask and the performance in downstream NLP tasks is not taken into consideration, and (3) high frequency words in the training data are masked more often, introducing noise due to this selection bias in the test cases. To overcome the above-mentioned disfluencies, we propose All Unmasked Likelihood (AUL), a bias evaluation measure that predicts all tokens in a test case given the MLM embedding of the unmasked input. We find that AUL accurately detects different types of biases in MLMs. We also propose AUL with attention weights (AULA) to evaluate tokens based on their importance in a sentence. However, unlike AUL and AULA, previously proposed bias evaluation measures for MLMs systematically overestimate the measured biases, and are heavily influenced by the unmasked tokens in the context.
研究动机与目标
- 解决现有掩码语言模型(MLMs)偏差评估度量的不可靠性问题,这些度量依赖于低准确率的掩码标记预测,并忽略了上下文引发的偏差。
- 克服因频繁掩码高频词而引起的评估选择偏差,该偏差因标记频率分布的偏斜而扭曲了偏差测量结果。
- 开发一种偏差评估方法,能够将模型内在偏差与微调或上下文依赖预测引入的偏差分离开来。
- 通过引入注意力权重反映标记的重要性,提升自动化偏差得分与人工标注偏差评分之间的一致性。
- 证明当前评估度量因对标记独立性的错误假设和预测置信度低,系统性地高估了偏差。
提出的方法
- 提出全未掩码似然(AUL),利用MLM同时预测句子中所有未掩码标记,使用完整的未掩码输入嵌入,避免掩码引起的畸变。
- 引入结合注意力权重的AUL(AULA),基于自注意力得分重新加权标记似然,以优先考虑语义重要标记,减少功能词带来的噪声。
- 将预测标记的伪似然作为偏差得分,其中反刻板印象句子的似然越低,表示检测到的偏差越高。
- 将AUL与AULA应用于两个基准数据集:StereoSet(SS)和CrowS-Pairs(CP),并与先前度量如SSS和CPS进行性能比较。
- 通过二分类任务(ROC-AUC)校准偏差检测,评估MLM得分与人工标注偏差标签之间的一致性。
- 通过打乱句子标记或用无关词语替换来开展消融研究,以检验AUL对语言连贯性和有意义关联的敏感性。
实验结果
研究问题
- RQ1现有MLM偏差评估度量在多大程度上因掩码标记预测准确率低且依赖模糊上下文中的伪似然而失效?
- RQ2掩码频率偏差(偏向高频词)在多大程度上影响了先前偏差评估度量的可靠性?
- RQ3一种能够同时预测所有未掩码标记的偏差评估方法,是否能减少噪声并提升对MLM中社会偏差的检测能力?
- RQ4AUL与AULA在CrowS-Pairs与StereoSet上与人工标注偏差判断的一致性如何,相较于先前度量表现如何?
- RQ5注意力机制在多大程度上通过适当地加权更有意义的标记来改善偏差评估?
主要发现
- 与基于伪似然的先前方法相比,AUL在StereoSet数据集上实现了95.71分的准确率下降,表明其在检测正确反刻板印象响应方面具有显著更高的可靠性。
- AULA在CrowS-Pairs上与人工标注偏差评分的一致性优于所有先前度量,通过ROC-AUC曲线显示出最高的一致性,尤其在检测细微偏差方面表现突出。
- 所提出的AUL方法对句子结构和语义敏感,表现为当标记被打乱或替换为无关词语时,性能出现显著下降。
- 先前度量如CPS和SSS因掩码频率偏差和独立性假设而系统性地高估偏差,CPS甚至在高频词被掩码时错误地将反刻板印象句子评为偏差更低。
- 所有评估的MLM模型——包括BERT、RoBERTa和ALBERT——均表现出令人担忧的社会偏差水平,证实内在偏差广泛存在,不限于特定模型架构。
- AUL与AULA在不同MLM和偏差类型上表现出鲁棒性,AULA在复杂、上下文敏感的案例中与人工标注偏差结果的相关性最强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。