Skip to main content
QUICK REVIEW

[논문 리뷰] The Endoscapes Dataset for Surgical Scene Segmentation, Object Detection, and Critical View of Safety Assessment: Official Splits and Benchmark

Aditya Murali, Deepak Alapatt|arXiv (Cornell University)|2023. 12. 19.
Colorectal Cancer Screening and Detection인용 수 7
한 줄 요약

이 논문은 복강경 담낭절제술 영상에서 수술 영역 분할, 객체 검출, 핵심 안전 시각(CVS) 평가를 위한 공식적인 분할을 제공하는 대규모 다중(annotation) 라벨링을 가진 Endoscapes2023을 소개한다. 다양한 annotation 예산 조건 하에서 딥러닝 모델의 성능을 평가할 수 있으며, 25%의 레이블 효율성 조건에서 48.8% mAP를 기록하여 CVS 예측 분야에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This technical report provides a detailed overview of Endoscapes, a dataset of laparoscopic cholecystectomy (LC) videos with highly intricate annotations targeted at automated assessment of the Critical View of Safety (CVS). Endoscapes comprises 201 LC videos with frames annotated sparsely but regularly with segmentation masks, bounding boxes, and CVS assessment by three different clinical experts. Altogether, there are 11090 frames annotated with CVS and 1933 frames annotated with tool and anatomy bounding boxes from the 201 videos, as well as an additional 422 frames from 50 of the 201 videos annotated with tool and anatomy segmentation masks. In this report, we provide detailed dataset statistics (size, class distribution, dataset splits, etc.) and a comprehensive performance benchmark for instance segmentation, object detection, and CVS prediction. The dataset and model checkpoints are publically available at https://github.com/CAMMA-public/Endoscapes.

연구 동기 및 목표

  • 복강경 수술에서 자동 핵심 안전 시각(CVS) 평가를 위한 대규모 고품질 데이터셋의 부족을 해결하기 위해.
  • 201개의 LC 영상에서 평가 가능한 영역을 체계적으로 1fps로 프레임 샘플링하여 이전 데이터셋의 선택 편향을 제거하기 위해.
  • 공식적인 훈련/검증/테스트 분할을 제공하고, 인스턴스 세그멘테이션, 객체 검출, CVS 예측의 세 가지 작업에 대한 종합적인 벤치마크를 제공하기 위해.
  • 실제 레이블링 비용 제약 조건을 시뮬레이션하기 위해, 효율적 학습을 위한 저레이블 설정(훈련 데이터의 12.5% 및 25%)을 제공하기 위해.
  • 세 명의 전문 임상의의 공감에 기반한 공통된 레이블을 사용하여 향후 수술 데이터 과학 연구를 위한 표준화된 벤치마크를 구축하기 위해.

제안 방법

  • 201개의 복강경 담낭절제술 영상에서 분석 단계 동안 1fps로 프레임을 샘플링하여 CVS 평가 가능한 영역에 대한 편향 없는 커버리지가 보장된 데이터셋을 구성하였다.
  • 세 명의 전문 임상의가 CVS를 평가하기 위해 각각 프레임을 이진 기준 3개로 별도로 레이블링하였으며, 총 11,090개의 레이블링된 프레임을 확보하였고, 정답 레이블은 다수결 투표로 정의되었다.
  • 5개 해부학적 구조와 1개의 수술 도구에 대해 총 1,933개의 프레임에서 세그멘테이션 마스크를 생성하였으며, 이 마스크에서 자동으로 바운딩 박스를 유도하였다.
  • 데이터셋은 세 가지 공식적인 서브데이터셋으로 분할되었다: Endoscapes-CVS201(CVS 레이블), Endoscapes-BBox201(바운딩 박스), Endoscapes-Seg50(50개 영상에 대한 세그멘테이션 마스크).
  • 벤치마크 평가에서는 LayoutCVS, DeepCVS, ResNet50-DetInit, LG-CVS, 그리고 시공간 모델인 STRG* 및 SV2LSTG*와 같은 최신 기술 기반 모델을 사용하였으며, 전체 및 저레이블 설정에서 평가하였다.
  • 훈련에는 역빈도 클래스 보정을 고려한 가중 이진 크로스엔트로피 손실을 사용하였고, mmdetection 프레임워크를 통해 COCO 사전학습 가중치에서 미세조정을 수행하였다.

실험 결과

연구 질문

  • RQ1대규모 편향 없는 수술 영상 데이터셋을 기반으로 현재의 딥러닝 모델이 자동 핵심 안전 시각(CVS) 평가에서 어떤 성능을 보이는가?
  • RQ2전체 및 저레이블 훈련 환경에서 CVS 레이블, 바운딩 박스, 인스턴스 세그멘테이션 마스크 등의 다양한 레이블 유형 간 모델 성능의 차이는 어떻게 되는가?
  • RQ3단일 프레임 기반 모델 대비 시공간 모델링이 CVS 예측 정확도 향상에 기여하는가?
  • RQ4세그멘테이션 또는 바운딩 박스 레이블링에 의존하지 않고, 훈련 데이터의 12.5% 또는 25%만으로도 CVS 예측 모델의 레이블 효율성은 어떠한가?
  • RQ5전문가들의 CVS 기준 레이블링 일관성은 얼마나 되며, 공감 기반 정답 레이블이 모델의 일반화 및 신뢰성 향상에 기여하는가?

주요 결과

  • 제안된 Endoscapes2023 데이터셋은 총 11,090개의 CVS 레이블링 프레임, 1,933개의 바운딩 박스 프레임, 201개 영상에서 493개의 인스턴스 세그멘테이션 마스크를 포함한다.
  • 저레이블 설정에서 ResNet50-MoCov2 모델은 훈련 데이터의 25%만으로도 CVS 예측에서 48.8% mAP와 63.6% 밸런스된 정확도를 달성하였다.
  • 성능이 가장 뛰어난 모델인 ResNet50-MoCov2는 25% 레이블 예산 조건에서 48.8% mAP를 기록하여 강력한 레이블 효율성을 입증하였다.
  • SV2LSTG* 방법은 수술 영상을 잠재적 시공간 그래프로 인코딩하는 방식으로, 특히 10프레임의 클립 크기에서 뛰어난 시공간 CVS 예측 성능을 보였다.
  • 벤치마크 결과에 따르면, Endoscapes-Seg50 + Endoscapes-CVS201로 훈련된 모델는 최상의 성능을 기록하였으며, 25% 레이블 예산 조건에서 최고 mAP가 48.8%에 도달하였다.
  • 공식적인 훈련/검증/테스트 분할과 세 명의 전문가가 일관되게 적용한 레이블링 프로토콜은 향후 평가에서 재현 가능성을 보장하고 편향을 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.