[论文解读] Vulnerability Analysis of Chest X-Ray Image Classification Against Adversarial Attacks
本论文评估了两种最先进的深度学习模型——Inception-ResNet-v2 和 Nasnet-Large——在白盒和黑盒设置下对十种对抗性攻击在胸部X光片分类任务中的脆弱性。结果表明,基于梯度的攻击最为有效,而将最大池化替换为平均池化可显著提高模型的鲁棒性,尤其在针对决策型和基于得分的攻击时,使用平均池化的Nasnet-Large模型表现出18%更高的鲁棒性。
Recently, there have been several successful deep learning approaches for automatically classifying chest X-ray images into different disease categories. However, there is not yet a comprehensive vulnerability analysis of these models against the so-called adversarial perturbations/attacks, which makes deep models more trustful in clinical practices. In this paper, we extensively analyzed the performance of two state-of-the-art classification deep networks on chest X-ray images. These two networks were attacked by three different categories (ten methods in total) of adversarial methods (both white- and black-box), namely gradient-based, score-based, and decision-based attacks. Furthermore, we modified the pooling operations in the two classification networks to measure their sensitivities against different attacks, on the specific task of chest X-ray classification.
研究动机与目标
- 评估深度学习模型在胸部X光片分类任务中对对抗性扰动的脆弱性。
- 评估多种对抗性攻击类型(基于梯度、基于得分、基于决策)在医学影像模型上的有效性。
- 探究修改池化操作(最大池化 vs. 平均池化)是否能增强模型对对抗性攻击的鲁棒性。
- 在ChestX-ray14数据集上比较模型在白盒与黑盒攻击场景下的性能表现。
- 评估对抗性样本对人类观察者的可察觉性及其对临床信任的影响。
提出的方法
- 在ChestX-ray14数据集上训练并评估了两种最先进的模型:Inception-ResNet-v2 和 Nasnet-Large。
- 在三类攻击中应用了十种对抗性攻击方法:五种基于梯度的攻击(FGSM、PGD、DeepFool、Linf-BIM、L-BFGS),两种基于得分的攻击(Local Search、Single Pixel),以及三种基于决策的攻击(Gaussian Blur、Contrast Reduction、Additive Gaussian Noise)。
- 同时开展了白盒攻击(使用相同模型生成和分类)和黑盒攻击(使用不同模型生成和分类)。
- 通过将最大池化替换为平均池化来修改网络结构,以评估其对对抗性扰动的敏感性。
- 使用准确率(Acc.)和受试者工作特征曲线下面积(AUROC)衡量模型在干净图像和扰动图像上的性能表现。
- 通过人类评估类别(明显、混合、困难)可视化对抗性样本的可察觉性。
实验结果
研究问题
- RQ1基于梯度、基于得分和基于决策的对抗性攻击在胸部X光片分类模型上的有效性如何?
- RQ2将最大池化替换为平均池化是否能提高模型对对抗性攻击的鲁棒性?
- RQ3模型在白盒与黑盒攻击设置下的性能退化程度如何?
- RQ4对抗性样本在多大程度上可被人类观察者察觉,这种可察觉性与攻击成功率之间有何关联?
- RQ5哪种攻击类型最能同时欺骗模型和人类感知?
主要发现
- 基于梯度的攻击(如PGD、L-BFGS)在白盒设置下几乎完全成功,导致两个模型的准确率均降至43–46%。
- 使用平均池化的模型鲁棒性得到提升:Nasnet-Large采用平均池化后相比其最大池化版本表现出18%更高的鲁棒性。
- 基于得分的攻击(如Local Search,S1)在采用平均池化的Nasnet-Large上完全失败,表明该模型对池化类型高度敏感。
- 基于决策的攻击(如Additive Gaussian Noise、Contrast Reduction)在23–30%的案例中可被人类察觉,可察觉性水平从“混合”到“明显”不等。
- 基于梯度的攻击在同时欺骗模型和人类观察者方面最为有效,其中27%的测试样本在使用最大池化时失败,使用平均池化时失败比例为23%。
- 在黑盒设置下,基于梯度的攻击依然最为有效,而采用平均池化的模型表现出更高的鲁棒性,尤其在针对基于得分和基于决策的攻击时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。