Skip to main content
QUICK REVIEW

[论文解读] Endoscopy Disease Detection and Segmentation (EDD2020)

Sharib Ali, Barbara Braden|arXiv (Cornell University)|Jan 15, 2020
Gastrointestinal Bleeding Diagnosis and Treatment参考文献 3被引用 15
一句话总结

本论文介绍了 EDD2020 挑战赛,这是一个多中心、多器官、多模态的内镜图像数据集,包含 386 幅经标注的胃肠道内镜图像帧,用于疾病检测与分割。该研究使用 mAP、IoU 和 F1 分数等指标,评估了深度学习模型在边界框定位、像素级分割以及分布外泛化能力方面的表现,尽管存在类别不平衡和复杂病例,其最佳集成模型仍实现了 45% 的平均 mAP。

ABSTRACT

Endoscopy is a widely used clinical procedure for the early detection of cancers in hollow-organs such as oesophagus, stomach, and colon. Computer-assisted methods for accurate and temporally consistent localisation and segmentation of diseased region-of-interests enable precise quantification and mapping of lesions from clinical endoscopy videos which is critical for monitoring and surgical planning. Innovations have the potential to improve current medical practices and refine healthcare systems worldwide. However, well-annotated, representative publically-available datasets for disease detection for assessing reproducibility and facilitating standardised comparison of methods is still lacking. Many methods to detect diseased regions in endoscopy have been proposed however these have primarily focussed on the task of polyp detection in the gastrointestinal tract with demonstration on datasets acquired from at most a few data centres and single modality imaging, most commonly white light. Here, we present our multi-class disease detection and segmentation challenge in clinical endoscopy. With this sub-challenge we aim to establish a comprehensive dataset to benchmark algorithms for disease detection.

研究动机与目标

  • 为解决胃肠道内镜疾病检测与分割领域缺乏全面、公开可用的多中心数据集的问题。
  • 建立一个基准,用于评估深度学习模型在多种器官和成像模态的真实临床数据上的表现。
  • 推动开发鲁棒、可泛化且具有临床应用价值的内镜计算机辅助诊断系统的研究。
  • 通过标准化指标评估模型在检测、分割及分布外泛化能力方面的性能。
  • 通过众包挑战赛框架促进可复现的研究和算法的对比评估。

提出的方法

  • 该数据集包含来自四个国际中心的 386 幅内镜图像帧,覆盖结肠、食管和胃,共包含五类疾病:NDBE、可疑病变、高级别异型增生、癌症和息肉。
  • 标注由临床专家和博士后研究人员使用 VIA 工具完成,边界框采用 PASCAL VOC 格式,分割掩码以五通道 TIFF 图像形式存储。
  • 评估包含三项任务:检测(边界框定位)、语义分割(像素级标注)以及分布外检测(对未见机构数据的泛化能力)。
  • 性能通过 mAPd(IoU 阈值在 0.25 至 0.75 之间,步长为 0.05 的平均精度均值)和 IoU 评估检测任务,通过 F1、F2、精确率和召回率评估分割任务。
  • 采用加权得分(0.6×mAPd + 0.4×IoUd)对参赛者进行排名,标准差用于平局判定。
  • 通过偏差分数 |mAPd − mAPg| 评估分布外泛化能力,数值越低表示模型鲁棒性越强。

实验结果

研究问题

  • RQ1深度学习模型在多种器官和成像模态下,对多种胃肠道疾病进行检测与定位的性能如何?
  • RQ2模型在未见机构和未包含在训练或验证集中的数据分布上,其泛化能力如何?
  • RQ3mAP 和 IoU 指标在内镜图像分析中与临床相关性如何?
  • RQ4类别不平衡(如癌症病例稀少)对模型性能和泛化能力有何影响?
  • RQ5集成方法是否能提升在具有挑战性、模糊或重叠病变情况下的检测与分割性能?

主要发现

  • 整个测试数据集的平均 mAP 为 35%,主要由于癌症样本不足以及复杂病例(如息肉与巴雷特黏膜重叠)所致。
  • 基线算法在 8 幅测试图像子集上实现了 58.52% 的 mAP,mAP25 和 mAP50 均为 62.5%,表明在代表性病例上定位能力较强。
  • 三个模型的集成将平均 mAP 提升至 45% 以上,表明模型组合在处理模糊或罕见病例方面具有显著优势。
  • 算法 1 未能检测到癌症,并将小片巴雷特黏膜误判为息肉,凸显了对细微病变识别的挑战。
  • 表现最佳的模型偏差分数极低(devg → 0),表明其在分布外数据上具有强大的泛化能力,且在训练数据与未见数据上的 mAP 保持一致。
  • 挑战赛揭示,小样本子集上的高 mAP 并不能保证在完整数据集上的优异表现,凸显了鲁棒性与泛化能力的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。