Skip to main content
QUICK REVIEW

[论文解读] DiagSet: a dataset for prostate cancer histopathological image classification

Michał Koziarski, Bogusław Cyganek|arXiv (Cornell University)|May 9, 2021
AI in cancer detection被引用 12
一句话总结

本文介绍了DiagSet,一个包含430张全切片图像(WSIs)的大规模组织病理学数据集,附有前列腺癌标注,并提出了一种基于多倍放大尺度的集成卷积神经网络(CNN)深度学习框架,用于分类癌变组织。该方法在切片级别分类中实现了94.6%的准确率,并在扫描级别诊断中与人类病理学家表现出高度一致性(Spearman相关系数r = 0.75–0.83),经统计假设检验和专家相关性分析验证。

ABSTRACT

Cancer diseases constitute one of the most significant societal challenges. In this paper, we introduce a novel histopathological dataset for prostate cancer detection. The proposed dataset, consisting of over 2.6 million tissue patches extracted from 430 fully annotated scans, 4675 scans with assigned binary diagnoses, and 46 scans with diagnoses independently provided by a group of histopathologists can be found at https://github.com/michalkoziarski/DiagSet. Furthermore, we propose a machine learning framework for detection of cancerous tissue regions and prediction of scan-level diagnosis, utilizing thresholding to abstain from the decision in uncertain cases. The proposed approach, composed of ensembles of deep neural networks operating on the histopathological scans at different scales, achieves 94.6% accuracy in patch-level recognition and is compared in a scan-level diagnosis with 9 human histopathologists showing high statistical agreement.

研究动机与目标

  • 为应对训练有素的组织病理学家短缺所导致的对可靠、自动化前列腺癌诊断日益增长的需求。
  • 创建一个大规模、完全标注的全切片图像(WSIs)数据集,附有标准化的Gleason分级,用于训练和基准测试深度学习模型。
  • 开发一种机器学习框架,结合多尺度深度神经网络与统计假设检验,以提高诊断可靠性并减少假阳性结果。
  • 通过相关性度量和统计验证,评估所提出系统与人类专家的性能表现。
  • 识别并分析影响模型性能的关键因素(如标签噪声、数据不平衡和数据量不足),为未来研究提供指导。

提出的方法

  • DiagSet数据集包含430张完全标注的WSIs,共4,675张扫描图像,附有二分类诊断(癌变/非癌变),以及46张由九位病理学家达成共识诊断的扫描图像。
  • 在不同放大倍数下提取的组织切片上,对多种预训练CNN架构(AlexNet、VGG16、VGG19、ResNet50、InceptionV3)进行微调。
  • 通过加权平均各类别的概率,将不同放大倍数尺度上训练的单个网络的预测结果进行集成,构建集成模型。
  • 采用参数检验(t检验)和非参数检验(Mann-Whitney U检验、Wilcoxon符号秩检验)的统计验证框架,评估预测结果的置信度。
  • 系统通过设定阈值,在不确定情况下选择不进行决策,从而提高鲁棒性并减少误诊。
  • 通过比较模型输出与九位人类病理学家在46张匿名WSIs上的诊断结果,评估扫描级别诊断性能,使用Spearman等级相关系数进行分析。

实验结果

研究问题

  • RQ1基于大规模、专家标注的数据集,多尺度深度学习集成模型能否在从组织病理学WSI中分类前列腺癌方面实现高准确率?
  • RQ2在诊断一致性和一致性方面,深度学习模型在DiagSet上的表现与人类病理学家相比如何?
  • RQ3在组织病理学图像分类任务中,哪些关键因素(如标签噪声、数据不平衡和数据量)会负面影响模型性能?
  • RQ4统计假设检验在多大程度上可通过实现不确定性感知决策,提升基于深度学习诊断的可靠性?
  • RQ5机器学习系统能否实现与人类专家相当的诊断一致性,达到人类专家间变异性的水平?

主要发现

  • 所提出的深度神经网络集成模型在二分类切片级别分类中实现了94.6%的准确率,最佳配置准确率达到94.67%。
  • 该机器学习系统与人类病理学家表现出高度相关性,46张WSI上的Spearman相关系数在0.75至0.83之间。
  • 人类病理学家之间的最低相关系数为0.64,表明模型的性能处于人类专家间变异性的范围内。
  • 统计假设检验框架有效识别出不确定的预测,使系统在置信度较低时能够选择不作决策。
  • 本研究识别出标签噪声、数据不平衡和数据量不足是影响模型性能的关键因素,为未来研究指明了方向。
  • DiagSet数据集已公开获取,网址为https://ai-econsilio.diag.pl,支持可复现性及计算病理学领域的进一步基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。