Skip to main content
QUICK REVIEW

[論文レビュー] The Endoscapes Dataset for Surgical Scene Segmentation, Object Detection, and Critical View of Safety Assessment: Official Splits and Benchmark

Aditya Murali, Deepak Alapatt|arXiv (Cornell University)|Dec 19, 2023
Colorectal Cancer Screening and Detection被引用数 7
ひとこと要約

本論文は、腹腔鏡胆嚢切除術動画における手術シーン分類、オブジェクト検出、および重要な安全性の視認(CVS)評価のための公式分割を備えた大規模かつマルチアノテーションのラプラスコピック胆嚢切除データセット、Endoscapes2023を紹介する。本データセットは、さまざまなアノテーション予算下でのディープラーニングモデルのベンチマーク評価を可能にし、25%のラベル効率下で48.8%のmAPを達成するなど、CVS予測分野で最先端の性能を実現した。

ABSTRACT

This technical report provides a detailed overview of Endoscapes, a dataset of laparoscopic cholecystectomy (LC) videos with highly intricate annotations targeted at automated assessment of the Critical View of Safety (CVS). Endoscapes comprises 201 LC videos with frames annotated sparsely but regularly with segmentation masks, bounding boxes, and CVS assessment by three different clinical experts. Altogether, there are 11090 frames annotated with CVS and 1933 frames annotated with tool and anatomy bounding boxes from the 201 videos, as well as an additional 422 frames from 50 of the 201 videos annotated with tool and anatomy segmentation masks. In this report, we provide detailed dataset statistics (size, class distribution, dataset splits, etc.) and a comprehensive performance benchmark for instance segmentation, object detection, and CVS prediction. The dataset and model checkpoints are publically available at https://github.com/CAMMA-public/Endoscapes.

研究の動機と目的

  • 腹腔鏡手術における自動的な重要な安全性の視認(CVS)評価のための、大規模かつ高品質なデータセットの不足を解消すること。
  • 201件のLC動画の評価可能な領域から一様にフレームを抽出(1fps)することで、従来のデータセットに見られる選択バイアスを排除すること。
  • 公式の訓練/検証/テスト分割を提供し、インスタンスセグメンテーション、オブジェクト検出、CVS予測の3つのタスクにおける包括的なベンチマークを提供すること。
  • 実世界のアノテーションコスト制約を再現するために、低ラベル設定(訓練データの12.5%および25%)を提供し、効率的な学習を可能にすること。
  • 3名の専門医によるコンSENSUSアノテーションを用いて、今後の手術データサイエンス分野の標準化されたベンチマークを確立すること。

提案手法

  • 201件の腹腔鏡胆嚢切除動画を対象とし、解離フェーズ中に1fpsでフレームを抽出することで、CVS評価可能な領域を偏りなくカバーする。
  • 3名の専門医がCVSを3つの二値基準に基づいて独立してアノテートし、合計11,090フレームをアノテート。正解ラベルは多数決によるものとする。
  • 5つの解剖学的構造および1つの手術用ツールのセグメンテーションマスクを1,933フレームに作成。ボクシングボックスはこれらのマスクから自動的に抽出された。
  • データセットは3つの公式サブデータセットに分割されている:Endoscapes-CVS201(CVSラベル)、Endoscapes-BBox201(ボクシングボックス)、Endoscapes-Seg50(50本の動画におけるセグメンテーションマスク)。
  • ベンチマーク評価には、LayoutCVS、DeepCVS、ResNet50-DetInit、LG-CVSに加え、STRG*およびSV2LSTG*といった時空間的手法を用い、フルラベルおよび低ラベル設定で評価した。
  • 訓練には逆頻度クラスバランスを考慮した重み付きバイナリクロスエントロピー損失を用い、mmdetectionフレームワークを用いてCOO-PRETRAINED重みから微調整した。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ偏りのない手術動画データセットを用いた場合、現在のディープラーニングモデルは自動的な重要な安全性の視認(CVS)評価でどの程度の性能を示すか?
  • RQ2フルラベルおよび低ラベル学習環境下で、CVSラベル、ボクシングボックス、インスタンスセグメンテーションマスクという異なるアノテーションタイプにおいて、モデルの性能はどのように変化するか?
  • RQ3時空間モデリングは、単一フレームベースラインと比較してCVS予測の正確性を向上させることができるか?
  • RQ4セグメンテーションやボクシングボックスアノテーションに依存せずに、訓練データの12.5%または25%でのみ学習した場合、CVS予測モデルのラベル効率はどの程度か?
  • RQ5専門医によるCVS基準のアノテーションはどれほど一貫性があるか?また、コンセンサスベースの正解ラベルはモデルの汎化性能および信頼性を向上させるか?

主な発見

  • 提案されたEndoscapes2023データセットには、CVSがアノテートされた11,090フレーム、ボクシングボックスがアノテートされた1,933フレーム、50本の動画におけるインスタンスセグメンテーションマスクが493フレーム含まれる。
  • 低ラベル設定下で、ResNet50-MoCov2モデルは訓練データの25%のみを用いても、CVS予測で48.8%のmAPおよび63.6%のバランス精度を達成した。
  • 最高性能を示したモデルであるResNet50-MoCov2は、25%のラベル予算下で48.8%のmAPを達成し、優れたラベル効率を示した。
  • SV2LSTG*手法は、手術動画を潜在的な空間時系列グラフとして符号化するもので、特に10フレームのクリップサイズで時空間的CVS予測において優れた性能を示した。
  • ベンチマーク結果から、Endoscapes-Seg50とEndoscapes-CVS201を併用して学習したモデルは、25%のラベル予算下で48.8%のmAPという上限性能に達した。
  • 公式の訓練/検証/テスト分割と、3名の専門医による一貫性のあるアノテーションプロトコルのおかげで、今後の評価における再現性が確保され、バイアスが低減される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。