Skip to main content
QUICK REVIEW

[论文解读] A multi-centre polyp detection and segmentation dataset for generalisability assessment

Sharib Ali, Debesh Jha|arXiv (Cornell University)|Jun 8, 2021
Radiomics and Machine Learning in Medical Imaging被引用 4
一句话总结

本论文提出了 PolypGen,一个大规模、多中心的结肠镜检查数据集,涵盖300多名患者,共包含3,762个息肉标注,包括单帧图像和视频序列。该数据集可支持对息肉检测与分割模型进行严格评估,结果表明,采用空洞空间金字塔池化的残差网络能有效提升模型在多样化临床环境下的泛化能力,其中ResNetUNet实现87 FPS的实时推理速度,并在序列数据上取得27.10的MASD边界精度表现。

ABSTRACT

Polyps in the colon are widely known cancer precursors identified by colonoscopy. Whilst most polyps are benign, the polyp's number, size and surface structure are linked to the risk of colon cancer. Several methods have been developed to automate polyp detection and segmentation. However, the main issue is that they are not tested rigorously on a large multicentre purpose-built dataset, one reason being the lack of a comprehensive public dataset. As a result, the developed methods may not generalise to different population datasets. To this extent, we have curated a dataset from six unique centres incorporating more than 300 patients. The dataset includes both single frame and sequence data with 3762 annotated polyp labels with precise delineation of polyp boundaries verified by six senior gastroenterologists. To our knowledge, this is the most comprehensive detection and pixel-level segmentation dataset (referred to as extit{PolypGen}) curated by a team of computational scientists and expert gastroenterologists. The paper provides insight into data construction and annotation strategies, quality assurance, and technical validation. Our dataset can be downloaded from \url{ https://doi.org/10.7303/syn26376615}.

研究动机与目标

  • 为解决结肠镜检查中息肉检测与分割领域缺乏全面、多中心数据集的问题。
  • 通过提供大规模、多中心数据集并附有专家验证的标注,提升模型在不同临床人群和成像条件下的泛化能力。
  • 支持在单帧和序列结肠镜数据上对深度学习模型进行基准测试,以评估时序建模能力和域偏移鲁棒性。
  • 通过提供按中心划分的数据集,支持联邦学习与迁移学习方法的开发与评估。
  • 通过提供标准化、高质量的数据集,减少息肉评估中的观察者间差异,为人工智能系统的训练与验证提供支持。

提出的方法

  • 从六个不同医疗中心收集的结肠镜数据,包括单帧图像和内镜视频序列。
  • 由六名资深胃肠病学家通过共识标注,生成3,762个精确的像素级息肉分割掩码。
  • 实施多阶段数据清洗流程,包括质量控制、数据平衡和专家审核,以确保标注的可靠性。
  • 提供基于中心的结构化数据划分,支持在不同临床机构间评估模型泛化能力。
  • 开发基准代码与评估工具,用于分割性能评估,包含DSC、NSD、MASD和HD等边界精度指标。
  • 采用最先进的深度学习架构(如ResNetUNet、DeepLabV3+)对数据集进行技术验证与性能基准测试。

实验结果

研究问题

  • RQ1现有息肉分割深度学习模型在具有真实世界成像差异的多样化、多中心数据集上的表现如何?
  • RQ2当在训练过程中未见过的中心的数据上进行评估时,模型性能下降的程度如何?应如何缓解这一问题?
  • RQ3哪些网络架构及组件(如残差连接、空洞空间金字塔池化)最能提升模型在不同临床环境下的泛化能力?
  • RQ4与DSC等标准指标相比,基于边界的指标(如MASD)在评估息肉分割性能时表现如何,特别是在小尺寸和中等尺寸息肉上?
  • RQ5所提出的数据集能否支持联邦学习与迁移学习策略在结肠镜AI系统中的开发与评估?

主要发现

  • 采用ResNet34主干的ResNetUNet在保持高分割精度(DSC与使用ResNet50的DeepLabV3+相当)的同时,实现了87 FPS的实时推理速度。
  • MASD指标显示,ResNetUNet在边界精度上优于DeepLabV3+,尤其在小尺寸和中等尺寸息肉上表现更优,单帧和序列数据上的得分分别为35.83 vs. 41.04,以及27.10 vs. 28.19。
  • 基础架构如原始UNet、PSPNet和FCN8因难以应对息肉尺寸变化和图像对比度变化,表现欠佳。
  • 在多中心数据合并后训练的模型出现更高的假阳性率,而基于中心的验证划分揭示了显著的性能差异,凸显了领域感知评估的重要性。
  • 表现最佳的模型能清晰检测到高对比度或明显黏膜隆起的息肉,但对平坦、无蒂或低对比度病变则表现不佳。
  • 该数据集的多样化数据分布(包括光照差异、视角变化和息肉形态多样性)暴露了当前模型的局限性,尤其在小息肉(<100×100像素)上表现更差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。