[论文解读] Breast density classification with deep convolutional neural networks
本文提出一种深度卷积神经网络(CNN),用于使用超过20万份筛查乳腺X线摄影检查的大型、临床真实数据集,实现自动化乳腺密度分类。该模型在多视角乳腺X线图像上进行训练,性能可与人类放射科医生相媲美,与专家读片高度一致,并为主观放射科评估提供了一种可重复、定量的替代方案。
Breast density classification is an essential part of breast cancer screening. Although a lot of prior work considered this problem as a task for learning algorithms, to our knowledge, all of them used small and not clinically realistic data both for training and evaluation of their models. In this work, we explore the limits of this task with a data set coming from over 200,000 breast cancer screening exams. We use this data to train and evaluate a strong convolutional neural network classifier. In a reader study, we find that our model can perform this task comparably to a human expert.
研究动机与目标
- 开发一种端到端的深度学习模型,用于乳腺密度分类,其性能优于传统手工设计特征方法。
- 在超过20万份筛查乳腺X线摄影检查的大型、临床真实数据集上评估该模型的性能。
- 比较该模型的分类准确率及其与人类专家(包括不同经验水平的放射科医生)的一致性。
- 建立基于高分辨率、多视角乳腺X线图像的深度学习在自动化乳腺密度评估方面的基准。
- 证明深度学习模型可在临床相关场景中实现与人类专家相当的性能。
提出的方法
- 该模型采用受Simonyan等人启发的多列深度卷积神经网络架构,专为四类乳腺密度分类而设计。
- 输入包含四种标准乳腺X线摄影视图(左前斜位、右前斜位、左斜位、右斜位),每幅图像分辨率为2600×2000像素。
- 网络采用批量归一化、ReLU激活函数,并使用带有四个单元的Softmax输出层,对应四种密度类别。
- 为进行比较,训练了一个基线模型,该模型使用像素强度直方图(10–20个区间)与Softmax回归,且分别在有无100个神经元的隐藏层的情况下进行训练。
- 数据集被划分为训练集、验证集和测试集,其中10%的训练数据用于早停和模型选择。
- 性能通过宏平均AUC(macAUC)、top-1、top-2和top-3准确率,以及“致密”与“非致密”超类分类进行评估。
实验结果
研究问题
- RQ1深度卷积神经网络是否能在多视角乳腺X线图像中实现与人类放射科医生相当的乳腺密度分类性能?
- RQ2在大型、临床真实数据集上,深度学习模型的性能与传统基于直方图的分类器相比如何?
- RQ3该深度学习模型在读者研究中与专家放射科医生及真实标签的一致性达到何种水平?
- RQ4该模型在“致密”与“非致密”超类分类中的表现是否与人类相当或更优?
- RQ5在大规模高分辨率乳腺X线图像数据集上训练的深度学习模型,能否为主观放射科评估提供一种可重复、定量的替代方案?
主要发现
- 最佳深度CNN模型实现了0.934的宏平均AUC(macAUC),优于人类专家的0.892 macAUC。
- 在四分类任务中,该模型实现了69.4%的top-1准确率、90.8%的top-2准确率和99.2%的top-3准确率。
- 在“致密”与“非致密”超类分类中,该模型达到了82.5%的准确率,超过人类专家平均的75.8%。
- Cohen’s kappa值显示,该模型与真实标签的一致性(kappa = 0.61)与专家间的一致性(kappa = 0.55–0.65)相当。
- 读者研究证实,该模型的性能与经验丰富的放射科医生相当,且在多位专家读者中表现出高度一致性。
- 本研究证明,基于大规模真实世界数据集训练的深度学习模型可在乳腺密度分类中实现人类水平的性能,为主观评估提供了一种可重复的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。