Skip to main content
QUICK REVIEW

[论文解读] Signet Ring Cell Detection With a Semi-supervised Learning Framework

Jiahui Li, Shuang Yang|arXiv (Cornell University)|Jul 9, 2019
AI in cancer detection参考文献 23被引用 16
一句话总结

本文提出了一种用于全切片图像中印戒细胞检测的新型半监督学习框架,结合自训练以优化噪声标注,并通过协同训练利用未标注区域。该方法在标注有限的真实临床数据集上实现了显著的性能提升——实例级FROC最高提升0.18,实现了准确且具有临床应用价值的检测。

ABSTRACT

Signet ring cell carcinoma is a type of rare adenocarcinoma with poor prognosis. Early detection leads to huge improvement of patients' survival rate. However, pathologists can only visually detect signet ring cells under the microscope. This procedure is not only laborious but also prone to omission. An automatic and accurate signet ring cell detection solution is thus important but has not been investigated before. In this paper, we take the first step to present a semi-supervised learning framework for the signet ring cell detection problem. Self-training is proposed to deal with the challenge of incomplete annotations, and cooperative-training is adapted to explore the unlabeled regions. Combining the two techniques, our semi-supervised learning framework can make better use of both labeled and unlabeled data. Experiments on large real clinical data demonstrate the effectiveness of our design. Our framework achieves accurate signet ring cell detection and can be readily applied in the clinical trails. The dataset will be released soon to facilitate the development of the area.

研究动机与目标

  • 解决病理学中自动化印戒细胞检测的缺失问题,这是早期诊断侵袭性腺癌的关键需求。
  • 克服临床全切片图像中不完整且存在噪声的标注问题,因为病理学家可能遗漏分散或密集分布的印戒细胞。
  • 开发一种半监督学习框架,有效利用有限的标注数据和全切片图像中丰富的未标注区域。
  • 通过自训练优化标注质量,以及通过未标注区域间的协同训练提升模型泛化能力,从而提高检测性能。
  • 通过在真实世界多器官全切片图像数据上展示稳健性能,降低标注成本,推动临床转化。

提出的方法

  • 提出一种自训练策略,从初始检测器预测中识别出高置信度的假阴性(被遗漏的印戒细胞),并将这些样本作为优化后的正样本标注,用于重新训练模型。
  • 实施一种协同训练策略,使用两个具有不同主干网络的检测器,在未标注区域中相互监督,利用彼此的高置信度预测作为伪标签。
  • 在自训练和协同训练中均采用迭代优化,逐步提升不同全切片图像和器官类型中的标注质量与模型泛化能力。
  • 使用紧密边界框作为12,381个印戒细胞的真值标注,覆盖来自10个器官的127张H&E染色全切片图像,每张全切片图像仅标注2–3个区域。
  • 利用印戒细胞的形态学特征——中央胞浆黏液滴伴偏心核——作为关键视觉线索进行检测。
  • 引入新的评估指标,包括集体水平召回率、实例级召回率和实例级FROC,以评估在标注不完美数据上的性能。

实验结果

研究问题

  • RQ1当仅有少量全切片图像被标注时,半监督学习框架能否有效提升印戒细胞检测的准确性?
  • RQ2自训练如何通过高置信度预测优化噪声真值标注,从而减轻不完整标注的影响?
  • RQ3在未标注区域间的协同训练在多器官及不同全切片图像特征下,能在多大程度上增强模型泛化能力?
  • RQ4为何自训练会放大某些假阳性(如中性粒细胞、浆细胞),而协同训练不会?这对模型鲁棒性有何影响?
  • RQ5所提出的框架能否在真实多器官全切片图像数据上实现临床可行的检测性能,且标注成本极低?

主要发现

  • 与完全监督基线相比,自训练在简单模式下使实例级FROC提升0.16,在困难模式下提升0.18,表明通过优化标注实现了显著的性能增益。
  • 协同训练缩小了简单模式与困难模式之间的性能差距,在简单模式下实现0.07的FROC提升,在困难模式下实现0.14的提升。
  • 在困难模式下,框架实现了0.827的集体水平召回率和0.658的实例级召回率,表明在具有挑战性的条件下仍具备强大的检测能力。
  • 在使用额外未标注区域时,自训练导致正常区域假阳性的数量急剧上升(5.22),表明噪声伪标签导致了错误放大。
  • 协同训练未放大特定假阳性(如中性粒细胞、浆细胞),表明其对噪声伪标签的鲁棒性优于自训练。
  • 模型成功捕捉了印戒细胞的细胞边界,如黄色多边形所示,为后续应用(如核浆比计算)提供了可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。