Skip to main content
QUICK REVIEW

[论文解读] Meta-repository of screening mammography classifiers

Stadnick, Benjamin, Jan Witowski|arXiv (Cornell University)|Aug 10, 2021
AI in cancer detection被引用 5
一句话总结

本文提出了一种用于筛查乳腺X线摄影AI模型的元仓库(meta-repository),实现了在七个国际数据集上的标准化评估。该研究使用AUC-ROC和AUC-PR指标,对比了五种开源、跨平台兼容的模型,展示了可复现的基准测试,以应对医学AI中普遍存在的模型可复现性和泛化性问题。

ABSTRACT

Artificial intelligence (AI) is showing promise in improving clinical diagnosis. In breast cancer screening, recent studies show that AI has the potential to improve early cancer diagnosis and reduce unnecessary workup. As the number of proposed models and their complexity grows, it is becoming increasingly difficult to re-implement them. To enable reproducibility of research and to enable comparison between different methods, we release a meta-repository containing models for classification of screening mammograms. This meta-repository creates a framework that enables the evaluation of AI models on any screening mammography data set. At its inception, our meta-repository contains five state-of-the-art models with open-source implementations and cross-platform compatibility. We compare their performance on seven international data sets. Our framework has a flexible design that can be generalized to other medical image analysis tasks. The meta-repository is available at https://www.github.com/nyukat/mammography_metarepository.

研究动机与目标

  • 为解决医学AI在乳腺癌筛查中日益严峻的可复现性与公平比较挑战。
  • 创建一个集中化、标准化的框架,用于在任何筛查乳腺X线摄影数据集上评估深度学习模型。
  • 使研究人员能够在不同国际数据集之间比较模型性能,即使这些数据集在采集协议和人群分布上存在差异。
  • 推动模型共享作为数据共享的可行替代方案,以应对伦理和法律限制。
  • 提供一种灵活的容器化基础设施,支持开源模型并保持一致的评估流程。

提出的方法

  • 该元仓库使用Docker容器化技术,标准化模型运行环境,确保在不同系统上的一致执行。
  • 每个模型均通过统一的入口脚本进行评估,该脚本处理输入图像、生成预测结果,并以标准化的CSV格式输出。
  • 性能通过AUC-ROC和AUC-PR指标自动计算,涵盖图像级别和乳腺级别预测。
  • 系统支持公开和私有数据集,可配置参数如不同数据分布的平均像素强度。
  • 通过配置文件处理特定模型的配置需求,包括对需要全部四个乳腺X线视图的模型(如DMV-CNN)的特殊处理。
  • 贡献者可通过拉取请求(pull requests)提交模型,附带Dockerfile、入口脚本和配置文件,实现与评估流程的集成。

实验结果

研究问题

  • RQ1如何在采集协议和人群特征各异的多样化国际数据集上,对筛查乳腺X线摄影AI模型实现一致的评估?
  • RQ2在标准化条件下评估时,最先进模型在不同数据分布上的泛化能力达到何种程度?
  • RQ3集中化的元仓库在多大程度上能提升医学影像研究中AI模型的可复现性与可比性?
  • RQ4超参数选择与模型架构对多个数据集上性能的影响如何?
  • RQ5在医学AI研究中,模型共享作为数据共享的替代方案,其有效性如何?

主要发现

  • 该元仓库成功实现了在七个国际筛查乳腺X线摄影数据集上对五种最先进模型的标准化评估。
  • 性能在不同数据集间存在显著差异,凸显了分布外泛化挑战,即使在表现最佳的模型中亦然。
  • 采用ResNet50主干网络并在INbreast数据集上微调的End2end模型,在NYU测试集上取得了最高的AUC-ROC(0.902)。
  • DMV-CNN模型需为缺少全部四个视图的数据集进行特殊配置,其性能对缺失数据较为敏感。
  • GLAM模型在联合训练变体(model_joint)下表现最佳,在CMMD数据集上达到AUC-ROC 0.885。
  • 元仓库的容器化框架确保了在不同硬件和软件环境下的结果一致性,有效支持了可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。