[论文解读] PolypDB: A Curated Multi-Center Dataset for Development of AI Algorithms in Colonoscopy
PolypDB 是一个大规模、多中心、多模态的数据集,包含来自 WLI、NBI 和 LCI 模态的 3,934 幅内镜息肉图像,经过精心整理以提升基于人工智能的息肉检测与分割性能。该研究对最先进模型进行了基准测试,表现出色——尤其是 SSFormer-L 和 YOLOv10 模型,mIoU 最高达 0.8821,F2 得分为 0.8941,为临床人工智能开发建立了稳健的基准。
Colonoscopy is the primary method for examination, detection, and removal of polyps. However, challenges such as variations among the endoscopists' skills, bowel quality preparation, and the complex nature of the large intestine contribute to high polyp miss-rate. These missed polyps can develop into cancer later, underscoring the importance of improving the detection methods. To address this gap of lack of publicly available, multi-center large and diverse datasets for developing automatic methods for polyp detection and segmentation, we introduce PolypDB, a large scale publicly available dataset that contains 3934 still polyp images and their corresponding ground truth from real colonoscopy videos. PolypDB comprises images from five modalities: Blue Light Imaging (BLI), Flexible Imaging Color Enhancement (FICE), Linked Color Imaging (LCI), Narrow Band Imaging (NBI), and White Light Imaging (WLI) from three medical centers in Norway, Sweden, and Vietnam. We provide a benchmark on each modality and center, including federated learning settings using popular segmentation and detection benchmarks. PolypDB is public and can be downloaded at \url{https://osf.io/pr7ms/}. More information about the dataset, segmentation, detection, federated learning benchmark and train-test split can be found at \url{https://github.com/DebeshJha/PolypDB}.
研究动机与目标
- 解决在结肠镜检查中训练鲁棒人工智能模型进行息肉检测与分割所面临的对多样化、真实世界数据的迫切需求。
- 通过整合来自地理上多样化的临床环境的多中心、多模态(WLI、NBI、LCI)内镜图像,克服现有数据集的局限性。
- 提供一个标准化基准,用于评估和比较不同成像模态下的最先进分割与检测模型。
- 通过包含各种息肉类型,包括具有挑战性的微小息肉和扁平息肉,提升模型的泛化能力与临床适用性。
- 支持开发能够降低息肉漏诊率并提高早期结直肠癌检测能力的人工智能系统。
提出的方法
- 从美国、瑞典、越南等地的 10 家医疗中心收集了 3,934 幅息肉图像,确保患者人口统计学特征和成像协议的多样性。
- 收集了三种内镜模态的图像:白光成像(WLI)、窄带成像(NBI)和共聚焦内镜(LCI),以反映真实世界的临床实践。
- 执行严格的数据整理工作,包括专家验证的息肉标注和质量控制,以确保高标注准确性。
- 使用标准指标(mIoU、mDSC、精确率、召回率和 F2 得分)在所有三种模态上对最先进分割与检测模型(如 SSFormer-L、YOLOv10、PVT-CASCADE)进行基准测试。
- 在 SSFormer-L 中采用 MiT-PLD-B4 主干网络,以增强多尺度特征学习能力,并提升在多样化视觉特征下的鲁棒性。
- 在不同模态间评估模型性能,以识别各模态的特异性优势,并指导临床部署决策。

实验结果
研究问题
- RQ1大规模、多中心、多模态数据集能否提升结肠镜检查中息肉检测与分割人工智能模型的泛化能力和鲁棒性?
- RQ2当在 PolypDB 上进行训练和评估时,最先进分割与检测模型在不同内镜成像模态(WLI、NBI、LCI)下的表现如何?
- RQ3在不同息肉类型和成像条件下,哪些模型架构在 mIoU、mDSC、召回率和 F2 得分方面表现最佳?
- RQ4在检测细微或具有挑战性的息肉结构(如微小或扁平息肉)方面,各模型之间的关键性能差异是什么?
- RQ5如何通过模态特定的基准测试指导在实时结肠镜检查环境中选择最优人工智能模型进行临床部署?
主要发现
- SSFormer-L 在 WLI 数据集上实现了最高的 mIoU(0.8821)和 mDSC(0.9294),同时具备出色的召回率(0.9314)和精确率(0.9438),表明分割精度极高。
- PVT-CASCADE 在 NBI 数据集上实现了最高的 F2 得分(0.8941)和召回率(0.9385),展现出在检测细微息肉结构方面的卓越性能。
- YOLOv10 和 SSFormer-L 在所有模态中均优于其他模型,为未来息肉检测与分割研究建立了强有力的基线。
- MiT-PLD-B4 主干网络通过实现跨多样化成像条件的有效多尺度特征提取,显著提升了模型的鲁棒性。
- PolypDB 的多中心和多模态设计使得模型能够实现更好的泛化能力,减少领域偏移,并增强真实世界临床适用性。
- 该数据集和基准为未来开发能够捕捉实时结肠镜检查过程中动态息肉检测的视频人工智能系统奠定了基础。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。