[论文解读] ACAT: Adversarial Counterfactual Attention for Classification and Detection in Medical Imaging
本文提出对抗性反事实注意力(ACAT),一种新颖的框架,通过利用对抗生成的反事实图像生成的显著性图,在多个尺度上生成软空间注意力掩码,从而提升医学影像中的分类准确率与鲁棒性。ACAT将脑部CT扫描的病灶分类准确率从71.39%提升至72.55%,将肺部CT扫描的准确率从67.71%提升至70.84%,优于基线模型和竞争方法,且无需人工标注感兴趣区域(ROI)。
In some medical imaging tasks and other settings where only small parts of the image are informative for the classification task, traditional CNNs can sometimes struggle to generalise. Manually annotated Regions of Interest (ROI) are sometimes used to isolate the most informative parts of the image. However, these are expensive to collect and may vary significantly across annotators. To overcome these issues, we propose a framework that employs saliency maps to obtain soft spatial attention masks that modulate the image features at different scales. We refer to our method as Adversarial Counterfactual Attention (ACAT). ACAT increases the baseline classification accuracy of lesions in brain CT scans from 71.39% to 72.55% and of COVID-19 related findings in lung CT scans from 67.71% to 70.84% and exceeds the performance of competing methods. We investigate the best way to generate the saliency maps employed in our architecture and propose a way to obtain them from adversarially generated counterfactual images. They are able to isolate the area of interest in brain and lung CT scans without using any manual annotations. In the task of localising the lesion location out of 6 possible regions, they obtain a score of 65.05% on brain CT scans, improving the score of 61.29% obtained with the best competing method.
研究动机与目标
- 为解决医学影像中信号-噪声比低的问题,即仅小部分区域具有诊断相关性,且传统卷积神经网络(CNN)难以泛化。
- 通过从数据驱动的显著性图中学习注意力掩码,消除对昂贵且不一致的人工感兴趣区域(ROI)标注的依赖。
- 通过基于显著性图生成的多尺度注意力掩码调制特征,提升模型鲁棒性与分类性能。
- 探究不同显著性图生成技术(尤其是对抗性反事实)在隔离诊断相关区域方面的有效性。
- 证明基于显著性图的注意力机制在性能上优于随机正则化或单尺度注意力。
提出的方法
- ACAT采用双分支架构:一个分支处理原始图像特征,另一个分支处理显著性图,以在多个网络尺度上生成软空间注意力掩码。
- 显著性图通过对抗性反事实生成方法生成,该方法寻找最小的潜在空间扰动,使输入向预训练分类器预测的目标类别偏移。
- 注意力掩码在网络的三个阶段(早期、中期、晚期)应用,以调制特征图,减少非信息区域的噪声。
- 注意力融合层使用可学习权重将多尺度注意力掩码进行融合,以更好地支持最终分类决策。
- 该框架端到端训练,显著性图生成器与分类器联合优化,以提升特征调制与预测准确率。
- 通过测量网络层中前激活方差评估鲁棒性,结果表明ACAT降低了方差,增强了输入扰动下的训练稳定性。

实验结果
研究问题
- RQ1能否从对抗性反事实中生成的显著性图有效隔离低信号医学图像中微小的、具有诊断意义的区域,而无需人工标注?
- RQ2与基线CNN相比,基于显著性图的多尺度注意力调制是否能提升脑部与肺部CT扫描任务的分类准确率?
- RQ3ACAT的注意力机制在性能与鲁棒性方面与随机丢弃或单尺度注意力相比如何?
- RQ4通过反事实方法生成的注意力掩码在多类别定位任务中,对病灶区域的定位准确率提升程度如何?
- RQ5ACAT的性能提升是源于有意义的注意力机制,还是仅源于随机特征丢弃的正则化效应?
主要发现
- 在IST-3脑部CT扫描中,ACAT将分类准确率从71.39%提升至72.55%,相对提升1.16个百分点。
- 在MosMed肺部CT扫描中,ACAT将准确率从67.71%提升至70.84%,相对提升3.13个百分点。
- 在脑部CT扫描中,ACAT的病灶定位得分为65.05%,优于最佳竞争方法的61.29%。
- 若移除注意力融合层,准确率降至69.79%;若移除所有注意力模块,性能进一步下降至68.23%,表明多尺度注意力的重要性。
- ACAT显著降低了所有网络层的前激活方差,尤其是在输入噪声下,表明其鲁棒性更强且优化更平滑。
- 随机丢弃实验表明,ACAT的性能提升无法通过随机特征丢弃复制,证实注意力掩码具有信息量,而非仅起正则化作用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。