Skip to main content
QUICK REVIEW

[论文解读] The Endoscapes Dataset for Surgical Scene Segmentation, Object Detection, and Critical View of Safety Assessment: Official Splits and Benchmark

Aditya Murali, Deepak Alapatt|arXiv (Cornell University)|Dec 19, 2023
Colorectal Cancer Screening and Detection被引用 7
一句话总结

本论文介绍了Endoscapes2023,这是一个大规模、多标注的腹腔镜胆囊切除术数据集,包含用于外科手术场景分割、目标检测和安全视图关键(CVS)评估的官方划分。该数据集支持在不同标注预算下对深度学习模型进行基准测试,在25%标注效率下实现了CVS预测的最先进性能,mAP达到48.8%。

ABSTRACT

This technical report provides a detailed overview of Endoscapes, a dataset of laparoscopic cholecystectomy (LC) videos with highly intricate annotations targeted at automated assessment of the Critical View of Safety (CVS). Endoscapes comprises 201 LC videos with frames annotated sparsely but regularly with segmentation masks, bounding boxes, and CVS assessment by three different clinical experts. Altogether, there are 11090 frames annotated with CVS and 1933 frames annotated with tool and anatomy bounding boxes from the 201 videos, as well as an additional 422 frames from 50 of the 201 videos annotated with tool and anatomy segmentation masks. In this report, we provide detailed dataset statistics (size, class distribution, dataset splits, etc.) and a comprehensive performance benchmark for instance segmentation, object detection, and CVS prediction. The dataset and model checkpoints are publically available at https://github.com/CAMMA-public/Endoscapes.

研究动机与目标

  • 为解决腹腔镜手术中自动化安全视图关键(CVS)评估缺乏大规模、高质量数据集的问题。
  • 通过从201例LC视频的可评估区域系统性地以1fps采样帧,消除先前数据集中的选择偏差。
  • 提供官方的训练/验证/测试划分,并在三个任务上进行全面基准测试:实例分割、目标检测和CVS预测。
  • 通过提供低标注设置(训练数据的12.5%和25%),模拟现实中的标注成本约束,以实现高效学习。
  • 通过三位临床专家的共识标注,为未来外科数据科学的研究建立标准化基准。

提出的方法

  • 该数据集包含201个腹腔镜胆囊切除术视频,帧在分离阶段以1fps采样,确保对CVS可评估区域的无偏覆盖。
  • 三位专家独立对CVS使用三个二元标准进行标注(共11,090帧标注),真实标签由多数投票确定。
  • 在1,933帧中为5个解剖结构和1个手术器械创建了分割掩码,并从这些掩码自动推导出边界框。
  • 该数据集被划分为三个官方子数据集:Endoscapes-CVS201(CVS标签)、Endoscapes-BBox201(边界框)和Endoscapes-Seg50(50个视频上的分割掩码)。
  • 基准测试使用了最先进模型,包括LayoutCVS、DeepCVS、ResNet50-DetInit、LG-CVS,以及时空方法如STRG*和SV2LSTG*,在完整和低标注设置下进行评估。
  • 训练采用加权二元交叉熵损失并进行类别频率逆向平衡,模型使用mmdetection框架从COCO预训练权重进行微调。

实验结果

研究问题

  • RQ1在使用大规模、无偏倚的外科视频数据集时,当前深度学习模型在自动化安全视图关键(CVS)评估中的表现如何?
  • RQ2在完整和低标注训练制度下,不同标注类型(CVS标签、边界框、实例分割掩码)对模型性能的影响如何?
  • RQ3与单帧基线相比,时空建模是否能提升CVS预测的准确性?
  • RQ4当仅使用25%或12.5%的训练数据进行训练时,CVS预测模型的标注效率如何,且无需依赖昂贵的分割或边界框标注?
  • RQ5专家对CVS标准的标注一致性如何?基于共识的真实标签是否能提升模型的泛化能力和可靠性?

主要发现

  • 所提出的Endoscapes2023数据集包含11,090帧CVS标注、1,933帧边界框标注,以及在201个视频中493帧的实例分割掩码。
  • 在低标注设置下,ResNet50-MoCov2模型在仅使用25%训练数据的情况下,CVS预测的mAP达到48.8%,平衡准确率达到63.6%。
  • 表现最佳的模型ResNet50-MoCov2在25%标注预算下实现了48.8%的mAP,展现出强大的标注效率。
  • SV2LSTG*方法通过将外科视频编码为潜在时空图,在时空CVS预测中表现出色,尤其在10帧片段大小下表现突出。
  • 基准结果表明,使用Endoscapes-Seg50与Endoscapes-CVS201联合训练的模型达到性能上限,最佳mAP在25%标注预算下达到48.8%。
  • 官方的训练/验证/测试划分以及三位专家一致的标注协议,确保了未来评估的可复现性并降低了偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。