Skip to main content
QUICK REVIEW

[논문 리뷰] Segmentation of Surgical Instruments for Minimally-Invasive Robot-Assisted Procedures Using Generative Deep Neural Networks

Iñigo Azqueta-Gavaldon, Florian A. Fröhlich|elib (German Aerospace Center)|2020. 06. 05.
Surgical Simulation and Training참고 문헌 16인용 수 4
한 줄 요약

이 논문은 MiroSurge 수술 기구의 현실적인 합성 내 endoscopic 영상 생성을 위해 CycleGAN 기반 도메인 적응을 사용하는 이단계 방법을 제안한다. 이를 통해 보정된 데이터로 훈련된 U-Net 모델을 활용해 고품질의 세분화를 달성한다. 이 방법은 실제 내 endoscopic 영상에서 평균 88.06%의 Intersection over Union (IoU)를 달성했으며, 도메인 이동으로 인해 발생하는 도메인 갭에도 불구하고 예상치 못한 da Vinci 기구에 대해 유망한 제로샷 일반화 성능을 보였다.

ABSTRACT

This work proves that semantic segmentation on minimally invasive surgical instruments can be improved by using training data that has been augmented through domain adaptation. The benefit of this method is twofold. Firstly, it suppresses the need of manually labeling thousands of images by transforming synthetic data into realistic-looking data. To achieve this, a CycleGAN model is used, which transforms a source dataset to approximate the domain distribution of a target dataset. Secondly, this newly generated data with perfect labels is utilized to train a semantic segmentation neural network, U-Net. This method shows generalization capabilities on data with variability regarding its rotation- position- and lighting conditions. Nevertheless, one of the caveats of this approach is that the model is unable to generalize well to other surgical instruments with a different shape from the one used for training. This is driven by the lack of a high variance in the geometric distribution of the training data. Future work will focus on making the model more scale-invariant and able to adapt to other types of surgical instruments previously unseen by the training.

연구 동기 및 목표

  • 로봇 보조 미세외과 수술에서 세분화를 위한 수동 레이블링의 비용과 노력을 줄이기 위해.
  • 합성 훈련 데이터와 실제 내 endoscopic 영상 간의 도메인 갭을 해결하여 모델의 일반화 능력을 향상시키기 위해.
  • 도메인 적응을 통해 보정된 합성 데이터만을 사용하여 실제 수술 기구 영상에서의 세분화 성능을 향상시키기 위해.
  • 다른 수술 시스템(da Vinci)에 대해 일반화 능력을 평가하기 위해, 이는 기구의 기하학적 형태와 외관이 다를 수 있음을 반영한다.

제안 방법

  • 비쌍화된 합성 및 실제 내 endoscopic 영상에 대해 CycleGAN을 훈련시어, 합성 기구 렌더링을 현실적인 내 endoscopic 외관으로 변환한다.
  • 도메인 적응된 합성 영상은 무거운 데이터 증강과 함께 U-Net 기반의 세분화 네트워크 훈련에 사용된다.
  • 합성 도메인과 실제 도메인 간의 자세와 기하학적 분포를 정밀하게 정렬하여 번역 정확도를 향상시킨다.
  • 완벽한 지도 레이블 세분화 마스크를 갖춘 현실적인 외관을 가진 합성 데이터셋을 기반으로 U-Net 모델을 엔드 투 엔드로 훈련시킨다.
  • 모델의 일반화 능력은 실제 MiroSurge 영상과 다양한 기구 유형 및 이미지 당 여러 기구를 포함하는 보류된 da Vinci 기구 데이터셋에서 평가된다.
  • U-Net의 강력한 특징 추출 능력과 스케일 인식 설계를 활용하며, 향후 MultiResUNet 또는 주의 메커니즘 통합 가능성이 있다.

실험 결과

연구 질문

  • RQ1CycleGAN을 통한 도메인 적응이 수술 기구의 합성 영상과 실제 내 endoscopic 영상 간의 도메인 갭을 효과적으로 해소할 수 있는가?
  • RQ2도메인 적응된 합성 데이터로 훈련된 세분화 모델이 원시 합성 데이터로 훈련된 모델보다 실제 수술 기구 세분화 성능에서 뛰어난 성능을 보일 수 있는가?
  • RQ3MiroSurge에서 훈련된 모델이 기하학적 형태, 질감, 색상이 다른 다른 수술 시스템(da Vinci)으로의 일반화 능력은 어느 정도인가?
  • RQ4실제 환경에서 기구의 크기, 위치, 조명 조건 변화에 따라 모델의 성능은 어떻게 변할까?

주요 결과

  • 제안된 방법은 MiroSurge 기구의 실제 내 endoscopic 영상에서 평균 88.06%의 Intersection over Union (IoU)를 달성했으며, 문헌에 기록된 최신 기술보다 뛰어난 성능을 보였다.
  • 모델는 기구의 형태, 질감, 색상의 상당한 도메인 이동에도 불구하고 da Vinci 수술 시스템에 대해 강력한 제로샷 일반화 성능을 보였으며, 평균 IoU는 50.28%를 기록했다.
  • 모델의 성능은 da Vinci 기구에서 크게 저하되었으며, 주로 기하학적 및 외관적 차이로 인해 발생했지만, 여러 사례에서 대부분의 기구를 탐지했다.
  • 가장 낮은 IoU 점수는 기구가 영상에서 비례적으로 매우 큰 부분을 차지하는 경우에 지속적으로 관찰되었으며, 이는 크기 민감도를 시사한다.
  • 이 방법은 CycleGAN을 통해 현실적인 외관으로 변환된 완벽한 레이블을 가진 합성 데이터를 활용하여 수동 레이블링의 필요성을 크게 줄였다.
  • 결과적으로, da Vinci 데이터에 대해 모델를 파라미터 조정하는 것이 성능 향상에 크게 기여할 수 있음을 시사하지만, 범위 제약으로 인해 이는 수행되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.