Skip to main content
QUICK REVIEW

[论文解读] NuCLS: A scalable crowdsourcing, deep learning approach and dataset for nucleus classification, localization and segmentation

Mohamed Amgad, Lamees A Atteya|arXiv (Cornell University)|Feb 18, 2021
AI in cancer detection参考文献 34被引用 7
一句话总结

本文提出了 NuCLS,一种可扩展的众包框架,利用医学生和病理学家对乳腺癌组织病理学图像中的细胞核进行标注,生成超过 220,000 个高质量标注。通过结合弱监督初始化与迭代优化,并引入一种新型的可学习嵌入决策树近似方法(DTALE),该方法在提升分割精度和模型可解释性的同时,显著降低了人工标注的工作负担。

ABSTRACT

High-resolution mapping of cells and tissue structures provides a foundation for developing interpretable machine-learning models for computational pathology. Deep learning algorithms can provide accurate mappings given large numbers of labeled instances for training and validation. Generating adequate volume of quality labels has emerged as a critical barrier in computational pathology given the time and effort required from pathologists. In this paper we describe an approach for engaging crowds of medical students and pathologists that was used to produce a dataset of over 220,000 annotations of cell nuclei in breast cancers. We show how suggested annotations generated by a weak algorithm can improve the accuracy of annotations generated by non-experts and can yield useful data for training segmentation algorithms without laborious manual tracing. We systematically examine interrater agreement and describe modifications to the MaskRCNN model to improve cell mapping. We also describe a technique we call Decision Tree Approximation of Learned Embeddings (DTALE) that leverages nucleus segmentations and morphologic features to improve the transparency of nucleus classification models. The annotation data produced in this study are freely available for algorithm development and benchmarking at: https://sites.google.com/view/nucls.

研究动机与目标

  • 解决计算病理学中深度学习大规模高质量组织病理学数据标注的关键瓶颈问题。
  • 通过可扩展的众包流程利用非专家医学生,降低手动标注所需的时间与专业知识要求。
  • 通过弱监督初始化与形态学特征融合,提升细胞核分割与分类模型的准确性和可解释性。
  • 通过可学习嵌入的决策树近似方法(DTALE)构建透明、可解释的深度学习模型,以增强临床信任度并支持模型调试。
  • 发布一个免费获取的、大规模的 220,000 个细胞核标注数据集,用于基准测试与推动计算病理学研究发展。

提出的方法

  • 设计了一个众包平台,通过基于网页的界面收集医学生和病理学家的细胞核标注,并集成质量控制机制。
  • 采用弱监督深度学习模型(在小规模专家标注数据集上预训练)提供初始分割建议,以指导非专家标注者,从而提高标注准确性。
  • 对 Mask R-CNN 架构进行改进,以增强在组织病理学图像中对小尺寸及重叠细胞核的实例分割性能。
  • 提出可学习嵌入的决策树近似方法(DTALE),通过将学习到的特征嵌入映射到细胞核的形态学特征,实现对模型预测的解释。
  • 系统性地使用 Fleiss’ Kappa 等统计指标评估标注者间的一致性,以确保跨标注者的数据质量。
  • 通过共识标注与质量过滤对最终数据集进行筛选,生成一个稳健且高精度的细胞核分析基准数据集。

实验结果

研究问题

  • RQ1是否能够通过包含非专家医学生的可扩展众包框架,生成与专家标注质量相当的细胞核标注?
  • RQ2提供弱监督模型建议在组织病理学图像分割中,如何提升非专家标注的准确性和效率?
  • RQ3对 Mask R-CNN 模型进行哪些修改,可显著提升其在具有挑战性的乳腺癌组织学图像中对细胞核实例分割的性能?
  • RQ4可学习嵌入的决策树近似方法(DTALE)是否能在不损失性能的前提下,提升深度学习模型在细胞核分类任务中的可解释性?
  • RQ5在大规模、多机构的细胞核标注任务中,不同标注者(医学生与病理学家)之间能达到何种水平的标注者间一致性?

主要发现

  • 众包数据集包含来自多个机构和成像平台的超过 220,000 个高质量细胞核标注,可公开免费使用。
  • 使用弱监督模型建议显著提升了非专家标注的准确性,减少了标注时间,并增强了标注者之间的一致性。
  • 改进后的 Mask R-CNN 在乳腺癌组织学图像的细胞核实例分割任务中达到最先进性能,优于标准实现。
  • DTALE 方法成功将学习到的深度特征映射到细胞核的形态学特征(如大小、形状、纹理),显著增强了模型的透明度与可解释性。
  • 标注者间一致性(Fleiss’ Kappa)达到中等到高度水平(κ ≈ 0.65–0.75),表明在不同标注者群体中具有可靠的共识。
  • 最终数据集展现出强大的泛化能力,在多个验证集和成像条件下均保持一致的高性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。