[论文解读] Global Saliency: Aggregating Saliency Maps to Assess Dataset Artefact Bias
本文提出全局显著性(global saliency),一种利用语义分割掩码在数据集范围内聚合显著性图的方法,以定量评估深度学习模型中由伪影(如墨水标记)引起的偏差。结果表明,基于有偏数据训练的模型对黑色素瘤和脂溢性角化病中的墨水标记赋予了过度显著的显著性,本文进一步提出一种采样策略以减轻此类偏差。
In high-stakes applications of machine learning models, interpretability methods provide guarantees that models are right for the right reasons. In medical imaging, saliency maps have become the standard tool for determining whether a neural model has learned relevant robust features, rather than artefactual noise. However, saliency maps are limited to local model explanation because they interpret predictions on an image-by-image basis. We propose aggregating saliency globally, using semantic segmentation masks, to provide quantitative measures of model bias across a dataset. To evaluate global saliency methods, we propose two metrics for quantifying the validity of saliency explanations. We apply the global saliency method to skin lesion diagnosis to determine the effect of artefacts, such as ink, on model bias.
研究动机与目标
- 为解决在皮肤病变诊断中对视觉伪影(如墨水标记)的模型偏差缺乏定量、全数据集范围评估的问题。
- 开发一种超越单张图像显著性解释的方法,以实现在整个数据集范围内对模型行为进行全局、对比性分析。
- 评估显著性图在反映真实模型决策过程方面的忠实度,特别是在存在混淆伪影的情况下。
- 提出一种训练采样策略,通过均衡类条件下的墨水共现概率,以减少伪影偏差。
提出的方法
- 利用语义分割掩码在图像间聚合显著性图,计算每类中伪影区域(如墨水)的平均或峰值显著性。
- 将全局显著性定义为在验证集上对所有伪影像素的平均显著性,并通过特定显著性方法的完整性属性对总显著性进行归一化。
- 引入两个指标:模型失效预测(墨水显著性与准确率下降之间的相关性)和数据集偏差检测(墨水显著性在不同类别间的方差)。
- 使用三个训练数据集,其墨水-类别共现概率各不相同:基线(现实世界偏差)、无偏(共现概率相等)和仅墨水(仅伪影)以隔离偏差效应。
- 应用梯度-激活图(grad-CAM)和竞争性梯度×输入显著性方法,利用其经验完整性属性以确保显著性总和的归一化。
- 通过在验证集上对墨水显著性阈值化后的子集评估模型性能,以分析显著性与预测准确率的相关性。
实验结果
研究问题
- RQ1显著性图在多大程度上反映了模型在整个数据集中对伪影(如墨水标记)的真实依赖程度,而非仅对前景特征的依赖?
- RQ2在皮肤病变分类中,伪影引起的偏差在不同诊断类别间如何变化?
- RQ3全局显著性指标是否能够以可量化的方式检测并度量偏差,从而支持跨模型比较与模型选择?
- RQ4通过采样减少伪影与标签之间的共现偏差,是否能显著降低伪影显著性并提升模型鲁棒性?
主要发现
- 基线模型在黑色素瘤(MEL)和脂溢性角化病(SK)中对墨水标记赋予了显著更高的显著性,相较于其他类别,其 Kendall’s τ = -0.889(p < 0.0001).
- 对于 MEL+SK 病变,过高的墨水显著性与更高的模型准确率相关,表明模型对墨水作为诊断线索存在虚假但有害的依赖。
- 无偏训练数据集将墨水显著性在类别间的方差从 0.007 降低至 0.003,尽管该差异未达统计显著性(Levene 检验,W=1.04,p=0.33)。
- 在训练中剔除病灶(病灶剔除模型)后,准确率仅为 28%,这否定了‘墨水外观的视觉差异导致偏差’的假设。
- 全局显著性框架成功检测到:在有偏数据上训练的模型会错误地将诊断相关性归因于墨水,尤其在 MEL 和 SK 中表现明显。
- 峰值显著性聚合在 grad-CAM 中与平均显著性结果相似,但在竞争性显著性方法中则不同,表明全局偏差检测对方法具有依赖性敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。