Skip to main content
QUICK REVIEW

[论文解读] Investigating Bias in Image Classification using Model Explanations

Schrasing Tong, Lalana Kagal|arXiv (Cornell University)|Dec 10, 2020
Explainable Artificial Intelligence (XAI)参考文献 13被引用 8
一句话总结

本文研究了模型解释方法——特别是Grad-CAM和TCAV——是否能够在不依赖显式敏感属性的情况下有效检测图像分类中的偏见。研究发现,尽管解释方法在高度偏见的模型中能够突出显示偏见特征,但其对偏见程度的估计效果较差,可能引入新的偏见,并且需要大量人工投入,限制了其在公平性评估中的实际应用价值。

ABSTRACT

We evaluated whether model explanations could efficiently detect bias in image classification by highlighting discriminating features, thereby removing the reliance on sensitive attributes for fairness calculations. To this end, we formulated important characteristics for bias detection and observed how explanations change as the degree of bias in models change. The paper identifies strengths and best practices for detecting bias using explanations, as well as three main weaknesses: explanations poorly estimate the degree of bias, could potentially introduce additional bias into the analysis, and are sometimes inefficient in terms of human effort involved.

研究动机与目标

  • 评估模型解释是否能够在不依赖标注敏感属性的情况下,高效检测图像分类中的偏见。
  • 评估Grad-CAM和TCAV在反映由偏见引起的实际性能差异方面的可靠性与忠实度。
  • 识别在实际部署中使用解释方法进行偏见检测的优势、劣势及最佳实践。
  • 比较基于解释的偏见检测与传统人工审计及公平性度量在效率和准确性方面的差异。
  • 探究解释方法是否能够稳健地反映模型行为随训练数据组成中偏见水平变化而产生的改变。

提出的方法

  • 精心构建了两个平衡且细粒度标注的数据集:医生与护士,以及篮球与排球运动员,其中控制了性别和种族属性。
  • 系统性地改变训练数据组成,以模拟从强偏见到最小偏见的不同偏见程度。
  • 对在不同偏见水平下训练的模型应用Grad-CAM和TCAV生成解释,分析解释模式如何随偏见水平变化。
  • 定义了操作性公平性度量(如M4、子组性能差异),以在不依赖敏感属性标签的情况下量化不公平性。
  • 开展人工评估,以衡量解释的可解释性及所需的人工投入,并与人工审计进行比较。
  • 分析TCAV中的概念选择是否导致偏见再现,特别考察诸如“性别”或“种族”等概念是否引入了混淆相关性。

实验结果

研究问题

  • RQ1在未显式访问敏感属性的情况下,Grad-CAM和TCAV能否可靠检测图像分类模型中的偏见?
  • RQ2解释方法在多大程度上准确估计了不同子组之间的不公平性或性能差异程度?
  • RQ3解释机制在概念选择或显著性映射过程中,会在多大程度上引入新的偏见?
  • RQ4解释的人工解读投入是否与使用细粒度标注数据集进行人工审计相当或更低?
  • RQ5当训练数据中的偏见水平变化时,解释方法是否能稳健地反映模型行为的变化?

主要发现

  • Grad-CAM和TCAV的解释通常能在高度偏见的模型中突出显示偏见特征,但也可能在相对无偏见的模型中产生类似模式,导致难以准确估计实际偏见程度。
  • TCAV得分在3:1和1:3偏见设置下与不公平性高度相关(例如,M4得分分别为37.5%和32.5%),但在所有偏见水平下未能一致反映性能差异。
  • 解读解释所需的人工投入与构建细粒度标注审计数据集相当,尤其在需要检测多个属性时更为明显。
  • 发现TCAV中的概念如“性别”隐含编码了种族(例如,白人比例更高),导致混淆相关性,从而在分析中引入了额外偏见。
  • Grad-CAM解释有时会突出显示与敏感属性无直接关联的非歧视性特征(如眼镜、球衣号码),但这些特征却被误认为是偏见指标。
  • 本研究未发现解释方法在效率上显著优于人工审计,且在某些情况下,由于忠实度和一致性问题,解释方法的可靠性更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。