Skip to main content
QUICK REVIEW

[论文解读] Failure Detection in Medical Image Classification: A Reality Check and Benchmarking Testbed

M. Brooke Bernhardt, Fabio De Sousa Ribeiro|arXiv (Cornell University)|May 27, 2022
Imbalanced Data Classification Techniques被引用 7
一句话总结

本文在6种不同数据集和模态的医学图像分类任务中,对9种置信度评分方法在域内故障检测中的表现进行了基准测试。出人意料的是,没有一种高级方法在所有情况下都优于简单的Softmax基线,揭示了提升分布外检测能力或模型校准性并不能确保更好的误分类检测性能,凸显了当前医疗人工智能安全领域存在的关键差距。

ABSTRACT

Failure detection in automated image classification is a critical safeguard for clinical deployment. Detected failure cases can be referred to human assessment, ensuring patient safety in computer-aided clinical decision making. Despite its paramount importance, there is insufficient evidence about the ability of state-of-the-art confidence scoring methods to detect test-time failures of classification models in the context of medical imaging. This paper provides a reality check, establishing the performance of in-domain misclassification detection methods, benchmarking 9 widely used confidence scores on 6 medical imaging datasets with different imaging modalities, in multiclass and binary classification settings. Our experiments show that the problem of failure detection is far from being solved. We found that none of the benchmarked advanced methods proposed in the computer vision and machine learning literature can consistently outperform a simple softmax baseline, demonstrating that improved out-of-distribution detection or model calibration do not necessarily translate to improved in-domain misclassification detection. Our developed testbed facilitates future work in this important area

研究动机与目标

  • 评估医学图像分类中域内故障检测方法在真实世界场景下的性能,重点关注临床安全的实际应用。
  • 评估最先进置信度评分方法(超越简单Softmax)是否能提升医学影像中误分类病例的检测能力。
  • 为未来医学人工智能故障检测研究建立一个全面且可复现的基准测试平台。
  • 挑战‘模型校准性提升或分布外检测能力增强即意味着域内误分类检测性能提升’这一假设。
  • 为临床部署前提供系统性、基于数据集的置信度评分评估基础。

提出的方法

  • 基准测试了9种广泛使用的置信度评分方法:Softmax、熵、主观不确定性与客观不确定性(贝叶斯神经网络)、蒙特卡洛Dropout,以及基于表征的评分方法(如马氏距离)。
  • 在涵盖6种不同模态(如X光、MRI、OCT)和分辨率(28×28至512×512像素)的6个医学影像数据集中评估所有方法。
  • 采用二分类与多分类分类设置,以评估不同任务类型和难度水平下的泛化能力。
  • 在所有置信度评分方法中保持一致的模型架构与正则化策略(如Dropout),以隔离评分方法本身带来的性能差异。
  • 采用标准评估指标:ROCAUC、FPR@80TPR,以及固定FPR下的真正率(TPR),以在符合临床实际的阈值下评估检测性能。
  • 通过GitHub公开发布测试平台,包含代码、模型和评估脚本,以支持可复现性及社区扩展。

实验结果

研究问题

  • RQ1在多种医学影像数据集中,先进置信度评分方法是否能持续优于简单的Softmax基线,以检测域内误分类?
  • RQ2模型校准性或分布外检测能力的提升,在多大程度上与更好的域内故障检测性能相关?
  • RQ3故障检测性能在不同成像模态、分辨率以及分类任务类型(二分类 vs. 多分类)之间如何变化?
  • RQ4在真实世界的医学影像场景中,最先进置信度评分与Softmax基线之间是否存在一致的性能差距?
  • RQ5所提出的基准测试平台能否作为评估未来医学人工智能故障检测方法的可靠且可扩展的平台?

主要发现

  • 在所有6个医学影像数据集中,9种基准置信度评分方法中没有一种能持续优于简单的Softmax基线。
  • Softmax基线在所有数据集中均实现了ROCAUC > 0.75,表明其能以显著优于随机猜测的水平检测误分类病例。
  • 所有方法和数据集的FPR@80TPR均保持较高水平(表明存在大量漏检错误),即使在20%假阳性率下,仍显示出显著的改进空间。
  • 在分布外检测或模型校准性方面表现更好,并未转化为更好的域内误分类检测性能,这削弱了这些指标作为代理指标的有效性。
  • 置信度评分的性能在不同数据集之间差异极大,表明方法性能高度依赖于数据集,缺乏可泛化性。
  • 本研究确立了故障检测问题尚未解决,需要专门针对任务的评估,而非依赖OOD鲁棒性等间接指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。