[论文解读] UDIS: Unsupervised Discovery of Bias in Deep Visual Recognition Models
UDIS 是一种无监督方法,通过识别模型系统性表现欠佳的子群体来发现深度视觉识别模型中的偏见,利用数据集嵌入的层次聚类和梯度加权类激活图(GradCAM)。它在无需受保护属性标注的情况下检测虚假相关性——例如将带有屏幕的图像误分类为'cup',或将泰迪熊与'bed'关联——并在 CelebA 和 MSCOCO 数据集上展示了有效性。
Deep learning models have been shown to learn spurious correlations from data that sometimes lead to systematic failures for certain subpopulations. Prior work has typically diagnosed this by crowdsourcing annotations for various protected attributes and measuring performance, which is both expensive to acquire and difficult to scale. In this work, we propose UDIS, an unsupervised algorithm for surfacing and analyzing such failure modes. UDIS identifies subpopulations via hierarchical clustering of dataset embeddings and surfaces systematic failure modes by visualizing low performing clusters along with their gradient-weighted class-activation maps. We show the effectiveness of UDIS in identifying failure modes in models trained for image classification on the CelebA and MSCOCO datasets.
研究动机与目标
- 解决在缺乏昂贵的人工标注受保护属性(如种族或性别)的情况下检测深度学习模型偏见的挑战。
- 开发一种无监督方法,识别模型性能显著下降的子群体,以指示由于虚假相关性导致的潜在失败模式。
- 实现在真实世界应用中部署前对深度学习模型进行可扩展、自动化的偏见审计。
- 使用 GradCAM 可视化并分析这些失败模式,帮助模型开发者理解并诊断偏见。
- 在真实世界数据集(如 CelebA 和 MSCOCO)上展示该方法的有效性,揭示上下文相关的虚假相关性。
提出的方法
- UDIS 对已训练模型测试集提取的深度特征嵌入执行层次聚类,以发现具有不同激活模式的子群体。
- 识别低性能聚类——即准确率显著低于整体测试集的聚类——以指示系统性失败模式。
- 针对每个低性能聚类,UDIS 生成 GradCAM 热力图,可视化模型在预测时关注的图像区域。
- 该方法利用模型的注意力图,揭示预测是基于相关特征还是无关的虚假线索(例如发色、衣领、屏幕)。
- UDIS 仅在测试集上运行,无需任何受保护属性的标注,因此具有可扩展性和成本效益。
- 该方法应用于在 CelebA(笑脸预测)和 MSCOCO(多标签分类)上训练的模型,揭示了诸如将屏幕与'cup'关联或泰迪熊与'bed'关联等偏见。
实验结果
研究问题
- RQ1无监督方法能否在无需受保护属性标注的情况下检测到深度视觉模型系统性表现欠佳的子群体?
- RQ2模型学习了哪些类型的虚假相关性(如依赖无关图像区域)导致特定子群体的性能下降?
- RQ3UDIS 在真实世界数据集中揭示与上下文相关的偏差特征(如屏幕、帽子、发色)相关的失败模式时,其有效性如何?
- RQ4GradCAM 可视化在解释和验证所发现失败模式的性质方面能发挥多大作用?
- RQ5UDIS 是否揭示了与已知文化或数据集偏见一致的偏见,例如对种族或性别等特定属性的过度泛化?
主要发现
- UDIS 在有偏见的 CelebA 数据集中成功识别出一个模型将注意力集中在发区的聚类,表明其学习到了对'Black Hair'属性的偏见,尽管该特征与笑脸预测无关。
- 在 MSCOCO 数据集中,UDIS 发现当图像中存在屏幕时,模型会过度预测'cup',揭示了屏幕与杯子之间的虚假相关性。
- 该方法还发现了模型在出现泰迪熊时即使没有床也会预测'bed',表明其学习到了泰迪熊与床之间的虚假关联。
- GradCAM 可视化证实,模型关注的是无关图像区域(如衣领或头发),而非实际目标(如笑脸中的嘴巴),表明模型因虚假特征而出现不稳定。
- UDIS 在无需任何受保护属性标注的情况下检测到多个聚类中的失败模式,证明了其可扩展性和无监督特性。
- 该工具揭示了模型在特定子群体中的性能显著下降,视觉解释显示注意力被错误地引导至非相关图像区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。