Skip to main content
QUICK REVIEW

[논문 리뷰] A real-time spatiotemporal AI model analyzes skill in open surgical videos

Emmett D. Goodman, Krishna Patel|arXiv (Cornell University)|2021. 12. 14.
Surgical Simulation and Training인용 수 6
한 줄 요약

이 논문은 50개국과 23개 수술 유형에서 YouTube에서 수집한 공개된 최대 규모의 개방 수술 영상 데이터셋—AVOS—를 기반으로 훈련된 실시간 시공간 다중 작업 AI 모델을 소개한다. 이 모델은 동시에 손, 도구, 행동 및 손 관절점을 탐지하며 수술 숙련도의 운동역학적 기술 특징을 식별하여 다양한 임상 환경에서의 일반화 능력을 입증하고, 손 움직임의 효율성에 의해 숙련도 수준을 예측할 수 있음을 보여준다.

ABSTRACT

Open procedures represent the dominant form of surgery worldwide. Artificial intelligence (AI) has the potential to optimize surgical practice and improve patient outcomes, but efforts have focused primarily on minimally invasive techniques. Our work overcomes existing data limitations for training AI models by curating, from YouTube, the largest dataset of open surgical videos to date: 1997 videos from 23 surgical procedures uploaded from 50 countries. Using this dataset, we developed a multi-task AI model capable of real-time understanding of surgical behaviors, hands, and tools - the building blocks of procedural flow and surgeon skill. We show that our model generalizes across diverse surgery types and environments. Illustrating this generalizability, we directly applied our YouTube-trained model to analyze open surgeries prospectively collected at an academic medical center and identified kinematic descriptors of surgical skill related to efficiency of hand motion. Our Annotated Videos of Open Surgery (AVOS) dataset and trained model will be made available for further development of surgical AI.

연구 동기 및 목표

  • 실시간 개방 수술 영상 분석을 위한 대규모이고 다양한 데이터셋이 부족한 문제를 해결하기 위해.
  • 다양한 환경에서 시공간적 수술 행동을 동시에 이해할 수 있는 실시간 다중 작업 AI 모델을 개발하기 위해.
  • 영상 데이터에서 임상 결과와 상관관계가 있는 수술 숙련도의 객관적 운동역학적 기술 특징을 식별하기 위해.
  • 공개된 영상으로 훈련된 AI 모델이 학술 의료기관에서 사전에 수집된 임상 데이터에 일반화될 수 있도록 하기 위해.
  • 연구를 가속화하기 위해 AVOS 데이터셋과 훈련된 모델을 공개하기 위해.

제안 방법

  • 23개 수술 유형과 50개국에서 YouTube에서 1,997개의 개방 수술 영상을 수집하여 AVOS 데이터셋을 구성하였다.
  • 손과 도구의 바운딩 박스, 21개의 손 관절점, 시간적 행동 레이블을 포함하여 343개 영상에 대한 애너테이션을 수행하였다.
  • 공유 백본을 갖춘 다중 작업 딥 러닝 모델을 개발하여 행동, 손 및 도구 탐지, 손 관절점 추정을 동시에 예측하였다.
  • 시공간 모델링을 통해 관절점 벡터 간 L1 거리 기반으로 프레임 간 손 자세와 운동 변화를 추적하였다.
  • 영상 시퀀스에서 행동 및 도구 사용 시간 경과 및 전이 확률을 포함한 30개의 해석 가능한 특징을 추출하기 위해 선형 판별 분석을 적용하였다.
  • 이론적 유효성 검증을 위해 이론적 유효성 검증을 수행하였으며, 학술 의료기관에서 사전에 수집된 데이터에 대한 일반화 성능을 테스트하였다.

실험 결과

연구 질문

  • RQ1다양하고 공개된 YouTube 영상으로 훈련된 다중 작업 AI 모델이 임상 환경에서의 개방 수술 절차를 실시간으로 분석하는 데 일반화될 수 있는가?
  • RQ2개방 수술에서 수술자의 숙련도 수준과 관련된 손 움직임의 운동역학적 특징은 무엇인가?
  • RQ3영상 품질, 줌 레벨, 수술 유형에 따라 모델 성능은 어떻게 달라지는가?
  • RQ4복잡한 실제 수술 환경에서 손, 도구, 행동을 고정밀도와 높은 재현율로 탐지하고 국소화할 수 있는가?
  • RQ5모델이 학습한 특징이 임상적으로 의미 있는 수술 숙련도 기술 특징을 얼마나 잘 반영하는가?

주요 결과

  • AVOS 데이터셋은 50개국에서 수집된 1,997개의 개방 수술 영상로 구성되어 있으며, 이 중 343개 영상가 손, 도구, 행동 및 21개의 손 관절점에 대해 완전히 애너테이션 처리되었다.
  • 다중 작업 모델은 다양한 영상 품질과 줌 레벨에서 높은 정밀도와 재현율을 달성하였으며, IOU 0.5 기준 도구 탐지의 mAP는 0.82, 손 탐지의 mAP는 0.85를 기록하였다.
  • 학술 의료기관에서 사전에 수집된 프로스펙티브 데이터셋에서도 모델이 강력한 성능을 보였으며, 수술 숙련도의 운동역학적 기술 특징을 성공적으로 식별하였다.
  • 손 움직임 효율성—시간에 따른 총 손 자세 변화 측정치—는 수술자의 숙련도 수준과 유의미하게 상관관계가 있었으며, 더 높은 수준의 숙련도를 가진 수술자는 더 낮은 운동 변동성을 보였다.
  • 이론적 유효성 검증에서 한 명의 수술자가 제거되었을 때도 숙련도 중심 분포에 유의미한 변화가 없었으며, 이는 모델이 개인 수술자 편향에 대해 강건함을 보여주었다.
  • 클래스 활성화 맵을 통해 모델의 해석 가능성을 검증하였으며, 손과 도구의 중심 부위가 탐지 신뢰도에 가장 영향을 미치는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.