[论文解读] CholecSeg8k: A Semantic Segmentation Dataset for Laparoscopic Cholecystectomy Based on Cholec80
CholecSeg8K 是一个开放式语义分割数据集,源自 Cholec80,涵盖 13 个类别的 8,080 帧用于腹腔镜胆囊切除,由 CC BY-NC-SA 4.0 授权发布。它提供像素级掩码和多种掩码格式,以支持在计算机辅助手术中的分割模型训练。
Computer-assisted surgery has been developed to enhance surgery correctness and safety. However, researchers and engineers suffer from limited annotated data to develop and train better algorithms. Consequently, the development of fundamental algorithms such as Simultaneous Localization and Mapping (SLAM) is limited. This article elaborates on the efforts of preparing the dataset for semantic segmentation, which is the foundation of many computer-assisted surgery mechanisms. Based on the Cholec80 dataset [3], we extracted 8,080 laparoscopic cholecystectomy image frames from 17 video clips in Cholec80 and annotated the images. The dataset is named CholecSeg8K and its total size is 3GB. Each of these images is annotated at pixel-level for thirteen classes, which are commonly founded in laparoscopic cholecystectomy surgery. CholecSeg8k is released under the license CC BY- NC-SA 4.0.
研究动机与目标
- 为内镜手术提供像素级语义分割数据集以支持算法开发(如 SLAM、分割模型)。
- 通过对 13 个手术特定类别对 Cholec80 进行帧标注来扩展,以实现对腹腔镜胆囊切除影像的情境理解。
- 提供现成可用的数据格式(原始图像、彩色掩码、注释掩码、分水岭掩码),以促进跨模型训练。
提出的方法
- 从 Cholec80 数据集的 17 个视频中提取 8,080 帧。
- 用与胆囊切除相关的 13 个预定义类别进行像素级注释。
- 为每张图像生成三种掩码格式(彩色掩码、注释掩码、分水岭掩码)。
- 将数据组织为按视频和帧索引的两级目录结构。
- 以 PNG 格式提供数据,授权在 CC BY-NC-SA 4.0 下许可证。
实验结果
研究问题
- RQ1如何从现有的内镜视频数据中创建高质量的逐像素语义分割数据集?
- RQ2在腹腔镜胆囊切除中,组织和器械的类分类法及其覆盖范围如何?
- RQ3有哪些实用的数据格式和组织方案能够最大化分割模型开发的可用性?
- RQ4注释帧中各类分布如何,对训练有何影响?
主要发现
- 该数据集由 8,080 帧组成,来自 17 个 Cholec80 视频。
- 定义了十三个像素级注释类别,其中包括器官(如肝脏、胆囊)和器械(如抓持器、L-hook 电凝器)。
- 图像分辨率为 854 × 480 像素,数据集总大小为 3 GB。
- 并非所有帧都包含所有 13 个类别;类别存在不平衡,某些工具仅占到注释像素的 1% 以下。
- 每帧有三个掩码(彩色掩码、注释掩码、分水岭掩码),均为 PNG 格式。
- 数据集在 CC BY-NC-SA 4.0 下发布,且可在 Kaggle 上获取。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。