Skip to main content
QUICK REVIEW

[논문 리뷰] CoPESD: A Multi-Level Surgical Motion Dataset for Training Large Vision-Language Models to Co-Pilot Endoscopic Submucosal Dissection

Guankun Wang, Han Xiao|arXiv (Cornell University)|2024. 10. 10.
Gastric Cancer Management and Outcomes인용 수 5
한 줄 요약

CoPESD는 Endoscopic Submucosal Dissection (ESD)을 위한 미세하고 다단계의 수술 모션 데이터셋을 도입하고, CoPESD에서 학습된 LVLM이 로봇의 저수준 모션을 예측하여 ESD 코파일럿으로 작동할 수 있음을 시연합니다.

ABSTRACT

submucosal dissection (ESD) enables rapid resection of large lesions, minimizing recurrence rates and improving long-term overall survival. Despite these advantages, ESD is technically challenging and carries high risks of complications, necessitating skilled surgeons and precise instruments. Recent advancements in Large Visual-Language Models (LVLMs) offer promising decision support and predictive planning capabilities for robotic systems, which can augment the accuracy of ESD and reduce procedural risks. However, existing datasets for multi-level fine-grained ESD surgical motion understanding are scarce and lack detailed annotations. In this paper, we design a hierarchical decomposition of ESD motion granularity and introduce a multi-level surgical motion dataset (CoPESD) for training LVLMs as the robotic extbf{Co}- extbf{P}ilot of extbf{E}ndoscopic extbf{S}ubmucosal extbf{D}issection. CoPESD includes 17,679 images with 32,699 bounding boxes and 88,395 multi-level motions, from over 35 hours of ESD videos for both robot-assisted and conventional surgeries. CoPESD enables granular analysis of ESD motions, focusing on the complex task of submucosal dissection. Extensive experiments on the LVLMs demonstrate the effectiveness of CoPESD in training LVLMs to predict following surgical robotic motions. As the first multimodal ESD motion dataset, CoPESD supports advanced research in ESD instruction-following and surgical automation. The dataset is available at \href{https://github.com/gkw0010/CoPESD}{https://github.com/gkw0010/CoPESD.}}

연구 동기 및 목표

  • ESD 모션을 세분화된 다단계로 분해하여 부분 자동화 및 LVLM 기반 코파일럿 기능을 가능하게 한다.
  • 로봇 보조 및 기존 ESD에서 이미지 + 바운딩 박스 + 다단계 모션으로 구성된 공개형 다중 모달 데이터셋을 생성한다.
  • 미세 조정된 LVLM이 수술 지시를 따르고 ESD를 위한 저수준 로봇 모션을 예측할 수 있음을 입증한다.
  • LVLM의 수술 자동화를 위한 지시 준수, 근거 제시, 모션 방향 정확도를 평가하는 벤치마크 및 평가 프로토콜을 확립한다.

제안 방법

  • ESD를 위한 계층적 모션 입자화(운영, 과제, 수술 어구, 모션 프리미티브, 모션 프리미티브 탐색)를 제안한다.
  • 로봇 보조 및 일반 ESD를 포함해 40개의 ESD 비디오를 수집하고 처리하여 32,699개의 바운딩 박스와 88,395개의 다층 모션을 가진 17,679장의 이미지를 산출한다.
  • 다층 모션으로 이미지를 주석하고, 두 내시경 의사의 교차 확인 및 품질 관리로 주석을 검증하며, 각 모션에 대해 ChatGPT를 사용해 다섯 가지 구문 변형을 생성해 텍스트 변variation을 확대한다.
  • CoPESD에 대해 최첨단 LVLM(SPHINX-X 및 LLaVA-1.5)을 LLaMA-2 백본으로 미세 조정하고, GPT 기반 응답 점수, 근거(평균 IoU), 모션 방향 정확도/ F-score로 평가한다.
  • 이미지 해상도 및 데이터 비율에 대한 절제 실험을 통해 지시 준수 및 모션 예측에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1다층 ESD 모션 데이터셋이 시각 입력과 텍스트 프롬프트로부터 저수준 로봇 모션을 예측하여 LVLM이 코파일럿으로 작동하게 할 수 있는가?
  • RQ2이미지 해상도와 훈련 데이터 크기가 LVLM의 ESD 지시 준수 및 기구 로컬라이제이션 능력에 어떤 영향을 미치는가?
  • RQ3다른 LVLM 백본 및 데이터셷 규모가 ESD에서의 문법 인식 모션 지시 생성 및 근거 제시 정확도에 어떤 영향을 주는가?
  • RQ4CoPESD가 로봇 보조 및 기존 ESD 시나리오 전반에서 강건한 지시 준수 및 모션 예측을 지원하는가?

주요 결과

  • CoPESD에서 미세 조정된 LVLM이 베이스라인보다 더 높은 GPT 기반 응답 품질과 더 강한 도구 근거를 달성한다.
  • 입력 이미지 해상도가 높을수록 모든 모델에서 모션 예측 정확도 및 localization(mIoU)이 향상된다.
  • 더 큰 LLM 백본이 일반적으로 지표 및 작업 전반에서 더 나은 성능을 보인다.
  • CoPESD의 최대 100% 활용은 더 작은 부분 집합에 비해 모션 유형과 방향 예측의 정확도 및 F-score에서 우수하다.
  • CoPESD는 LVLM이 ESD 현장에서 정확한 다음 단계 모션 설명을 생성하고 도구를 위치시키도록 한다.
  • CoPESD는 최초의 다중 모달 ESD 모션 데이터셋으로, 지시 준수 및 수술 자동화 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.