Skip to main content
QUICK REVIEW

[논문 리뷰] Comparative Validation of Machine Learning Algorithms for Surgical Workflow and Skill Analysis with the HeiChole Benchmark

Martin Wagner, Beat P. Müller‐Stich|arXiv (Cornell University)|2021. 09. 30.
Surgical Simulation and Training인용 수 6
한 줄 요약

이 연구는 HeiChole 벤치마크를 사용하여 복강경 담낭절제술 영상 33건으로 구성된 다중 센터 데이터셋을 바탕으로 수술 워크플로우 및 기술 분석을 위한 기계학습 알고리즘을 평가한다. 단계 인식에서는 뛰어난 성능(최대 F1 67.7%)을 보였으나, 행동 인식과 기술 평가에서는 여전히 도전 과제로 남아 있으며, F1 점수는 21.8–23.3%이며 평균 오차는 0.78로 나타나, 잠재력은 높지만 여전히 해결되지 않은 분야임을 시사한다.

ABSTRACT

PURPOSE: Surgical workflow and skill analysis are key technologies for the next generation of cognitive surgical assistance systems. These systems could increase the safety of the operation through context-sensitive warnings and semi-autonomous robotic assistance or improve training of surgeons via data-driven feedback. In surgical workflow analysis up to 91% average precision has been reported for phase recognition on an open data single-center dataset. In this work we investigated the generalizability of phase recognition algorithms in a multi-center setting including more difficult recognition tasks such as surgical action and surgical skill. METHODS: To achieve this goal, a dataset with 33 laparoscopic cholecystectomy videos from three surgical centers with a total operation time of 22 hours was created. Labels included annotation of seven surgical phases with 250 phase transitions, 5514 occurences of four surgical actions, 6980 occurences of 21 surgical instruments from seven instrument categories and 495 skill classifications in five skill dimensions. The dataset was used in the 2019 Endoscopic Vision challenge, sub-challenge for surgical workflow and skill analysis. Here, 12 teams submitted their machine learning algorithms for recognition of phase, action, instrument and/or skill assessment. RESULTS: F1-scores were achieved for phase recognition between 23.9% and 67.7% (n=9 teams), for instrument presence detection between 38.5% and 63.8% (n=8 teams), but for action recognition only between 21.8% and 23.3% (n=5 teams). The average absolute error for skill assessment was 0.78 (n=1 team). CONCLUSION: Surgical workflow and skill analysis are promising technologies to support the surgical team, but are not solved yet, as shown by our comparison of algorithms. This novel benchmark can be used for comparable evaluation and validation of future work.

연구 동기 및 목표

  • 단일 센터 데이터셋을 초월하여 수술 단계 인식 알고리즘의 일반화 능력을 평가하기 위해.
  • 다중 센터 환경에서 수술 행동 인식, 기구 탐지 및 기술 평가를 위한 기계학습 모델을 평가하기 위해.
  • 수술 AI 시스템 간 비교 평가를 위한 표준화된 벤치마크를 수립하기 위해.
  • 현재 수술 워크플로우 및 기술 분석 알고리즘의 성능 격차를 규명하기 위해.

제안 방법

  • 세 개의 수술 센터에서 수집한 33건의 복강경 담낭절제술 영상으로 구성된 다중 센터 데이터셋을 확보하였으며, 총 22시간의 수술 시간을 포함한다.
  • Annotation에는 일곱 가지 수술 단계(250회의 전환), 5,514건의 수술 행동, 21종류의 기구 총 6,980건의 인스턴스, 다섯 가지 차원에서의 495건의 기술 평가가 포함되었다.
  • 이 데이터셋은 2019년 엔도스코픽 비전 챌린지의 하위 과제인 수술 워크플로우 및 기술 분석 과제로 사용되었으며, 총 12개 팀이 알고리즘을 제출하였다.
  • 알고리즘 평가는 단계, 행동 및 기구 인식에 대해 F1 점수를, 기술 평가에 대해서는 평균 절대 오차를 사용하여 평가되었다.
  • 실제 수술 환경에서의 내구성과 일반화 능력을 평가하기 위해 팀 간 성능을 비교하였다.
  • HeiChole 벤치마크는 향후 연구를 위한 표준화된 평가 플랫폼으로 확립되었다.

실험 결과

연구 질문

  • RQ1수술 단계 인식을 위한 기계학습 모델은 다중 수술 센터 간에 얼마나 잘 일반화되는가?
  • RQ2행동 인식 성능는 단계 및 기구 인식 성능와 비교해 볼 때 어떠한가?
  • RQ3기계학습 모델은 다차원적으로 수술 기술을 정확하게 평가할 수 있는가?
  • RQ4현재 수술 워크플로우 및 기술 분석 시스템의 핵심 제약 요소는 무엇인가?
  • RQ5HeiChole 벤치마크는 수술 AI 알고리즘의 공정하고 비교 가능한 평가를 어떻게 가능하게 하는가?

주요 결과

  • 9개 팀의 단계 인식에서 F1 점수는 23.9%에서 67.7% 사이로 다양하게 나타나 성능의 변동성과 향상 여지를 시사한다.
  • 8개 팀의 기구 존재 탐지에서 F1 점수는 38.5%에서 63.8% 사이로 중간 수준이지만 일관성 없음을 보였다.
  • 행동 인식 성능는 가장 열악했으며, 5개 팀의 F1 점수는 21.8%에서 23.3% 사이로 나타났다.
  • 기술 평가의 평균 절대 오차는 0.78로 나타나 정량적 기술 평가의 심각한 부정확성을 보였다.
  • HeiChole 벤치마크는 현재 알고리즘이 실생활 수술 적용에 아직 충분히 강건하거나 신뢰할 만하지 않음을 드러냈다.
  • 연구는 수술 워크플로우 및 기술 분석이 기술적 잠재력은 높지만 여전히 해결되지 않은 과제임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.