Skip to main content
QUICK REVIEW

[论文解读] ERS: a novel comprehensive endoscopy image dataset for machine learning, compliant with the MST 3.0 specification

Jan Cychnerski, Tomasz Dziubich|arXiv (Cornell University)|Jan 21, 2022
Colorectal Cancer Screening and Detection被引用 4
一句话总结

本论文介绍了 ERS,一个大规模、多标签的内镜图像数据集,包含约 115,000 幅近似标注的图像帧和 123 万幅未标注的图像帧,数据来源为柔性内镜与胶囊内镜,完全符合 MST 3.0 术语标准。该数据集可支持高性能深度学习模型的训练,在二分类任务中实现高达 94% 的 F1 分数,并通过基于 MobileNet 的分类器过滤正常帧,显著减少视频长度(最高达 80%),从而加速临床审查流程。

ABSTRACT

The article presents a new multi-label comprehensive image dataset from flexible endoscopy, colonoscopy and capsule endoscopy, named ERS. The collection has been labeled according to the full medical specification of 'Minimum Standard Terminology 3.0' (MST 3.0), describing all possible findings in the gastrointestinal tract (104 possible labels), extended with an additional 19 labels useful in common machine learning applications. The dataset contains around 6000 precisely and 115,000 approximately labeled frames from endoscopy videos, 3600 precise and 22,600 approximate segmentation masks, and 1.23 million unlabeled frames from flexible and capsule endoscopy videos. The labeled data cover almost entirely the MST 3.0 standard. The data came from 1520 videos of 1135 patients. Additionally, this paper proposes and describes four exemplary experiments in gastrointestinal image classification task performed using the created dataset. The obtained results indicate the high usefulness and flexibility of the dataset in training and testing machine learning algorithms in the field of endoscopic data analysis.

研究动机与目标

  • 为解决胃肠道诊断中机器学习领域公开可用、标准化且全面的内镜数据集严重缺乏的问题。
  • 创建一个大规模、多标签的数据集,符合胃肠道病变最小术语标准 3.0(MST 3.0),以实现在多种胃肠道发现中的统一标注。
  • 支持自动检测结肠镜与胶囊内镜中息肉、出血及其他胃肠道异常的机器学习模型的开发与基准测试。
  • 评估基于 ERS 数据集的深度学习模型在多类别与二分类任务中的性能,重点关注其在真实临床场景中的实用性。
  • 通过展示使用训练好的分类器自动过滤正常帧,显著缩短视频审查时间,证明该数据集的实际影响。

提出的方法

  • ERS 数据集包含来自 1,135 名患者的 1,520 个内镜视频,涵盖柔性结肠镜、胃镜和无线胶囊内镜,其中包含 6,000 幅精确标注的图像帧和 11.5 万幅近似标注的图像帧。
  • 所有图像均使用完整的 104 个标签 MST 3.0 术语进行标注,并额外扩展了 19 个与机器学习应用相关的标签。
  • 数据集包含 3,600 幅精确标注和 22,600 幅近似标注的病变定位分割掩码,支持分类与分割任务。
  • 通过卷积神经网络(CNN)进行了四项基准实验,包括 MobileNet、NASNet-Mobile 等模型,针对多类别(10 类)、中等类别(5 类)和二分类(2 类)问题。
  • 基于训练好的 MobileNet 模型,应用了一种视频过滤算法,用于移除无异常的帧,通过调节敏感性和特异性参数以平衡检测准确率与视频长度减少效果。
  • 性能评估采用 F1 分数,通过按患者图像数量进行平衡来缓解类别不平衡问题,尽管该方法对模型性能影响较小。

实验结果

研究问题

  • RQ1一个大规模、标准化且全面的、符合 MST 3.0 标准的内镜数据集,是否能提升胃肠道诊断中机器学习模型的性能与可重复性?
  • RQ2不同深度学习架构(如 MobileNet、NASNet-Mobile)在 ERS 数据集上,针对不同分类复杂度(2 类、5 类、10 类)的表现如何?
  • RQ3通过使用训练好的分类器自动过滤正常帧,能在多大程度上减少胶囊内镜视频审查所需的时间?
  • RQ4精确标注与近似标注在病变检测任务中的可用性,对模型性能有何影响?
  • RQ5数据不平衡与患者层面的数据分布对多类别分类中模型泛化能力与 F1 分数有何影响?

主要发现

  • ERS 数据集包含 11.5 万幅近似标注的图像帧和 123 万幅未标注的图像帧,来自 1,520 个内镜视频,覆盖了几乎全部 MST 3.0 术语类别。
  • 在 10 类分类任务中,正常组织、模糊图像和静脉曲张的 F1 分数为 86–90%,大多数疾病的 F1 分数为 75–78%,而罕见疾病(如克罗恩病)因训练数据有限(仅 84 幅图像),F1 分数较低(38%)。
  • 在 5 类分类任务中,疾病类别的 F1 分数为 80–85%,健康组织类别的 F1 分数为 92%,优于 10 类设置,原因在于类别复杂度降低且无低资源类别。
  • 在 2 类分类任务(异常 vs. 健康组织)中,F1 分数达到 88%,MobileNet 表现最佳,且使用不精确标注略微提升了结果。
  • BLUR 检测任务的 F1 分数最高,达到 94%,表明模型在该特定分类任务中表现优异。
  • 将训练好的 MobileNet 分类器应用于 WCE 视频,可在 99% 敏感性下将视频长度减少 16%,在较低敏感性阈值下减少超过 80%,显著加速临床审查流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。