[论文解读] Measuring and Reducing Gendered Correlations in Pre-trained Models
本文提出度量标准来检测预训练模型中的性别相关性,显示具有相似准确度的模型也可能具有非常不同的相关性水平,并展示减轻相关性的方法(dropout 和对照事实数据增强)在保持准确度的同时降低相关性,且在微调后效果仍然存在。
Pre-trained models have revolutionized natural language understanding. However, researchers have found they can encode artifacts undesired in many applications, such as professions correlating with one gender more than another. We explore such gendered correlations as a case study for how to address unintended correlations in pre-trained models. We define metrics and reveal that it is possible for models with similar accuracy to encode correlations at very different rates. We show how measured correlations can be reduced with general-purpose techniques, and highlight the trade offs different strategies have. With these results, we make recommendations for training robust models: (1) carefully evaluate unintended correlations, (2) be mindful of seemingly innocuous configuration differences, and (3) focus on general mitigations.
研究动机与目标
- 定义一个框架和度量标准,用于检测预训练模型及下游任务中的性别相关性。
- 证明具有相似准确度的模型可能具有不同水平的性别相关性。
- 评估减缓策略(dropout 正则化和对照事实数据增强)及其权衡。
- 表明在微调前的缓解措施会传播到下游任务并提高对重新学习相关性的鲁棒性。
提出的方法
- 提出一个多指标评估框架,包含内在度量(DisCo)和外在度量(Coref、STS-B、Bias-in-Bios),用于性别相关性。
- 开发结合模板式文本和生成式文本的内在 DisCo 分析,以发现相关性。
- 在微调后使用标准下游任务(共指消解、STS-B 风格相似度、Bias-in-Bios)来评估实践中的相关性。
- 对模型变体(BERT、ALBERT;不同规模)进行实验,以在独立于准确度的情况下比较相关性水平。
- 应用两种通用的缓解技术:(i)预训练期间的 dropout 正则化,(ii)预训练期间的对照事实数据增强(CDA),包括双向增强。
实验结果
研究问题
- RQ1具有相似准确度的预训练模型是否以不同速率编码性别相关性?
- RQ2通用缓解措施是否能在不牺牲下游任务性能的情况下减少性别相关性?
- RQ3预训练阶段的缓解措施会否延伸到微调并削弱重新学习相关性?
- RQ4在降低相关性方面,dropout 与对照事实数据增强之间的权衡是什么?
主要发现
- 具有相似准确度的模型在性别相关性指标上可能存在较大差异(例如共指、STS-B、Bias-in-Bios)。
- dropout 正则化在多项指标上降低性别相关性且不会造成显著准确度损失;然而,过高的 dropout 可能损害某些任务,如共指。
- 对照事实数据增强(CDA)能有效降低相关性,通常对整体准确度影响较小,并且可以推广到增augmented 术语之外。
- 预训练阶段的缓解措施使模型在微调期间对重新学习相关性具有抵抗力,并且在某些条件下,部分冻结的缓解模型在保持准确度的同时保持较低的相关性。
- BERT 和 ALBERT 展现不同的相关性基线水平,且没有单一架构/尺寸能普遍最小化相关性;建议进行精确的多指标评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。