[论文解读] Measuring Fairness with Biased Rulers: A Survey on Quantifying Biases in Pretrained Language Models
本文综述了 BERT 等上下文嵌入语言模型的公平性度量方法,评估其与下游偏见的兼容性与相关性。研究发现,内在度量方法对模板、种子词和嵌入选择高度敏感,导致结果不一致;作者建议优先在下游任务中进行外在公平性评估,并使用与嵌入无关的度量方法(如 DisCo 或 LPBS)替代基于嵌入的度量方法。
An increasing awareness of biased patterns in natural language processing resources, like BERT, has motivated many metrics to quantify `bias' and `fairness'. But comparing the results of different metrics and the works that evaluate with such metrics remains difficult, if not outright impossible. We survey the existing literature on fairness metrics for pretrained language models and experimentally evaluate compatibility, including both biases in language models as in their downstream tasks. We do this by a mixture of traditional literature survey and correlation analysis, as well as by running empirical evaluations. We find that many metrics are not compatible and highly depend on (i) templates, (ii) attribute and target seeds and (iii) the choice of embeddings. These results indicate that fairness or bias evaluation remains challenging for contextualized language models, if not at least highly subjective. To improve future comparisons and fairness evaluations, we recommend avoiding embedding-based metrics and focusing on fairness evaluations in downstream tasks.
研究动机与目标
- 综述上下文嵌入语言模型(如 BERT)的现有公平性度量方法。
- 评估这些度量方法在不同配置(模板、种子词、嵌入)下的兼容性与一致性。
- 探究内在公平性度量与下游任务中外在偏见之间的关系。
- 为 NLP 系统中可靠偏见评估提供可操作建议。
- 指出当前度量方法的局限性,并警示不应过度依赖内在度量作为现实世界公平性的代理指标。
提出的方法
- 对上下文嵌入语言模型的公平性度量进行了全面的文献调研。
- 使用五种主流模型进行了实证评估:BERT-base-uncased、BERT-large-uncased、RoBERTa-base、DistilBERT-base-uncased 和 BERT-base-multilingual-uncased。
- 通过内在公平性度量与外在基准 BiasInBios 之间的相关性分析,评估其一致性。
- 评估不同模板、种子词选择以及嵌入表示(如 [CLS]、目标词嵌入)对度量稳定性的影响。
- 使用 BiasInBios 数据集进行微调与评估,实现内在与外在偏见度量之间的对比。
- 在 https://github.com/iPieter/biased-rulers 发布了代码与公平性度量包,以支持可复现性与复用。
实验结果
研究问题
- RQ1对于 BERT 等上下文嵌入语言模型,存在哪些公平性度量方法?
- RQ2这些公平性度量方法在英语之外的语言中如何泛化?
- RQ3公平性度量方法、其使用的模板以及嵌入选择之间存在何种关系?
- RQ4哪组公平性度量方法在偏见评估中最为可靠且兼容?
主要发现
- 许多内在公平性度量方法因对模板设计、种子词选择和嵌入表示高度敏感而存在不兼容性。
- 使用目标词嵌入而非 [CLS] 嵌入,可在不同模板下获得更稳定、更鲁棒的度量结果。
- 内在公平性度量与外在公平性度量(如 BiasInBios)之间的相关性通常较弱或为负,表明内在度量与下游任务中真实世界的偏见缺乏对齐。
- CrowS-pairs 等度量方法与 BiasInBios 的相关性较低,部分原因在于模板与表示方式的差异,凸显其不稳定性。
- Tan 和 Celis(2019)提出的 WEAT 变体与外在偏见表现出相对较强的关联性,表明其在内在度量中可能更具可靠性。
- 本研究结论认为,基于嵌入的内在度量方法引入了显著的方差,应避免使用,而应优先选择与嵌入无关的替代方法(如 DisCo 或 LPBS),且在下游任务中进行外在公平性评估对于有意义的公平性评估至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。