Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation for Detection of Architectural Distortion in Digital Mammography using Deep Learning Approach

Arthur C. Costa, Helder C. R. Oliveira|arXiv (Cornell University)|Jul 6, 2018
AI in cancer detection参考文献 6被引用 12
一句话总结

本研究提出了一种数据增强策略,用于训练卷积神经网络(CNN)以检测数字乳腺X线摄影中的结构扭曲(AD),这是一种细微的早期乳腺癌征象。尽管临床图像数据集有限(仅300幅),但通过数据增强将训练样本扩充至21,600个,使CNN在真实测试集上实现了0.74的AUC,证明了在数据受限条件下利用深度学习进行早期癌症检测的可行性。

ABSTRACT

Early detection of breast cancer can increase treatment efficiency. Architectural Distortion (AD) is a very subtle contraction of the breast tissue and may represent the earliest sign of cancer. Since it is very likely to be unnoticed by radiologists, several approaches have been proposed over the years but none using deep learning techniques. To train a Convolutional Neural Network (CNN), which is a deep neural architecture, is necessary a huge amount of data. To overcome this problem, this paper proposes a data augmentation approach applied to clinical image dataset to properly train a CNN. Results using receiver operating characteristic analysis showed that with a very limited dataset we could train a CNN to detect AD in digital mammography with area under the curve (AUC = 0.74).

研究动机与目标

  • 为解决在乳腺X线摄影中训练深度学习模型时临床数据有限的挑战。
  • 提高对结构扭曲(AD)的检测能力,AD是乳腺癌一种细微且早期的征象,常被放射科医生遗漏。
  • 开发并评估一种数据增强策略,以扩展小规模临床数据集,实现有效的CNN训练。
  • 评估训练后的CNN在真实、具有临床相关性的测试场景中的性能。

提出的方法

  • 本研究使用了包含300幅临床乳腺X线图像的数据集,其中200幅来自DDSM数据集,100幅在机构审查委员会批准下获取。
  • 基于放射科医生标注的AD位置和正常组织,人工裁剪出感兴趣区域(ROIs),共获得600个ROIs。
  • 数据增强方法包括垂直/水平翻转、90°、180°和270°旋转,以及高斯噪声(方差为0.02、0.04、0.06),将数据集扩充至21,600个样本,并实现类别平衡。
  • 使用TensorFlow实现CNN,采用5×5卷积核、最大池化和4×4全连接层,采用z分数标准化,在70%-15%-15%的训练-验证-测试划分下进行训练。
  • 在9份新检查的测试集中,每幅图像提取约3,000个ROIs,根据中心坐标将其分类为AD或正常组织。

实验结果

研究问题

  • RQ1数据增强能否有效补偿在乳腺X线摄影中结构扭曲检测的CNN训练中临床数据有限的问题?
  • RQ2在真实临床环境中,基于增强数据训练的CNN在新、未见过的乳腺X线检查中泛化能力如何?
  • RQ3在真实测试场景下,该方法的诊断性能(以AUC和准确率衡量)如何?

主要发现

  • CNN在9份新乳腺X线检查的真实测试集中实现了0.74的AUC,表明尽管训练数据有限,仍具有实际诊断潜力。
  • 在训练和验证划分中,模型准确率达到99.4%,AUC为0.99,表明其内部学习能力极强。
  • 数据增强策略成功将初始的600个ROIs扩展至21,600个样本,实现了类别平衡,有效支持了CNN训练。
  • 模型在真实测试集上的表现(AUC=0.74,准确率=86.1%)证实了其在早期乳腺癌检测中临床部署的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。