[论文解读] BMAD: Benchmarks for Medical Anomaly Detection
BMAD 提供了一个标准化、全面的医学异常检测(MAD)基准,涵盖五个医学影像领域(脑部 MRI、肝脏 CT、视网膜 OCT、胸部 X 光和组织病理学)的六个精选数据集,包含 14 种最先进(SOTA)的异常检测(AD)模型以及三种评估指标(AUROC、PRO、DICE)。该基准实现了公平、可复现的比较,并通过统一的代码库和预训练模型,加速了无监督医学 AD 领域的发展。
Anomaly detection (AD) is a fundamental research problem in machine learning and computer vision, with practical applications in industrial inspection, video surveillance, and medical diagnosis. In medical imaging, AD is especially vital for detecting and diagnosing anomalies that may indicate rare diseases or conditions. However, there is a lack of a universal and fair benchmark for evaluating AD methods on medical images, which hinders the development of more generalized and robust AD methods in this specific domain. To bridge this gap, we introduce a comprehensive evaluation benchmark for assessing anomaly detection methods on medical images. This benchmark encompasses six reorganized datasets from five medical domains (i.e. brain MRI, liver CT, retinal OCT, chest X-ray, and digital histopathology) and three key evaluation metrics, and includes a total of fourteen state-of-the-art AD algorithms. This standardized and well-curated medical benchmark with the well-structured codebase enables comprehensive comparisons among recently proposed anomaly detection methods. It will facilitate the community to conduct a fair comparison and advance the field of AD on medical imaging. More information on BMAD is available in our GitHub repository: https://github.com/DorisBao/BMAD
研究动机与目标
- 为解决医学影像上异常检测方法缺乏标准化、公平的评估基准的问题。
- 将来自不同领域的现有医学影像数据集统一并重新组织为一致、可直接评估的格式,以支持异常检测。
- 实现对医学影像中先进异常检测模型的全面、可复现的比较。
- 提供一个文档齐全、开源的代码库,涵盖所有 14 种评估方法的训练和推理流程。
- 通过系统性评估,识别性能差距和潜在研究方向,以促进未来研究。
提出的方法
- 该基准整合了来自五个领域的六个重新组织的医学影像数据集:BraTS2021(脑部 MRI)、BTCV+LiTs(肝脏 CT)、RESC(视网膜 OCT)、NIH-ChestXRay(胸部 X 光)以及三个组织病理学数据集(TCGA-NSCLC、TCGA-KIRC、TCGA-KIRP)。
- 数据集经过预处理以确保一致性:使用正常样本进行训练,异常样本则保留在评估中,必要时提供像素级和样本级标注。
- 该基准评估了 14 种最先进的无监督异常检测模型,包括基于重建的方法(如自编码器、GAN、扩散模型)和基于特征嵌入的方法(如 PatchCore、PaDiM、DRAEM、STFPM)。
- 采用三种评估指标:AUROC(图像级和像素级)、每区域重叠(PRO)和骰子系数(阈值依赖),并对骰子系数进行了阈值优化探索。
- 通过 GitHub 提供统一的代码库,支持使用一致超参数和数据划分的训练、推理与评估。
- 每种方法的超参数均经过优化(例如,CS-Flow 使用 Adam 优化器,初始初始学习率为 2e-4,权重衰减为 1e-5,梯度钳制为 1,流钳制为 3)。
实验结果
研究问题
- RQ1在标准化评估下,最先进异常检测模型在多样化医学影像领域中的表现如何?
- RQ2基于重建与基于特征嵌入的异常检测方法在医学影像中各自的优缺点是什么?
- RQ3模型性能与泛化能力在不同医学影像模态(如 MRI 与 OCT 与组织病理学)之间差异有多大?
- RQ4不同的评估指标(AUROC、PRO、Dice)与临床相关性及定位准确性之间的相关性如何?
- RQ5当前医学 AD 方法中的主要瓶颈是什么?基准结果提示了哪些关键研究方向?
主要发现
- 在 BraTS2021 数据集上,PatchCore 在像素级 AUROC 上达到 32.82±0.59 的最高分,优于其他模型(如 CFA 的 30.22±0.32 和 STFPM 的 25.40±0.82)。
- 在 BTCV+LiTs 数据集上,CFA 达到 14.93±0.08 的 AUROC,为所有方法中的最高分,表明其在肝脏 CT 上表现优异。
- 在 RESC 数据集上,PatchCore 达到 57.04±0.21 的最高 DICE 分数,表明其在视网膜 OCT 异常定位方面具有卓越的准确性。
- 在 RESC 数据集上,STFPM 达到 49.23±0.23 的最高 DICE 分数,凸显其在细粒度异常定位方面的强大性能。
- DICE 分数对阈值高度敏感;通过最优阈值调优,性能可显著超越 0.5 的基准阈值(例如,PatchCore 的 DICE 分数可从 57.04 提升至更高值)。
- 该基准表明,没有单一模型在所有领域中全面占优,凸显了对领域特定适应以及泛化能力进一步研究的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。