Skip to main content
QUICK REVIEW

[논문 리뷰] ST-MTL: Spatio-Temporal Multitask Learning Model to Predict Scanpath While Tracking Instruments in Robotic Surgery

Mobarakol Islam, Vibashan VS|PubMed|2021. 12. 10.
Surgical Simulation and Training참고 문헌 56인용 수 7
한 줄 요약

이 논문은 로봇 수술에서 실시간 수술 기구 세분화와 임무 인식 시각적 주의도 탐지 작업을 동시에 수행하는 엔드 투 엔드 공간-시간 다중 작업 학습 모델인 ST-MTL을 제안한다. 비동기 공간-시간 최적화(ASOT), 경쟁적 압축-흥신전 모듈(SC-scSE), 그리고 장거리 시간적 모델링을 위한 수정된 ConvLSTM++을 도입함으로써, MICCAI 2017 로봇 기구 세분화 도전 대회에서 최신 기술 수준의 성능을 달성하였으며, 이중 세분화 및 유형 세분화 지표에서 전체 우승자보다 뛰어난 성능을 보였다.

ABSTRACT

Representation learning of the task-oriented attention while tracking instrument holds vast potential in image-guided robotic surgery. Incorporating cognitive ability to automate the camera control enables the surgeon to concentrate more on dealing with surgical instruments. The objective is to reduce the operation time and facilitate the surgery for both surgeons and patients. We propose an end-to-end trainable Spatio-Temporal Multi-Task Learning (ST-MTL) model with a shared encoder and spatio-temporal decoders for the real-time surgical instrument segmentation and task-oriented saliency detection. In the MTL model of shared-parameters, optimizing multiple loss functions into a convergence point is still an open challenge. We tackle the problem with a novel asynchronous spatio-temporal optimization (ASTO) technique by calculating independent gradients for each decoder. We also design a competitive squeeze and excitation unit by casting a skip connection that retains weak features, excites strong features, and performs dynamic spatial and channel-wise feature recalibration. To capture better long term spatio-temporal dependencies, we enhance the long-short term memory (LSTM) module by concatenating high-level encoder features of consecutive frames. We also introduce Sinkhorn regularized loss to enhance task-oriented saliency detection by preserving computational efficiency. We generate the task-aware saliency maps and scanpath of the instruments on the dataset of the MICCAI 2017 robotic instrument segmentation challenge. Compared to the state-of-the-art segmentation and saliency methods, our model outperforms most of the evaluation metrics and produces an outstanding performance in the challenge.

연구 동기 및 목표

  • 예측 스캔패스 모델링을 통해 로봇 수술에서 수술사의 작업 부담을 줄이고 엔도스코프 카메라 제어를 자동화한다.
  • 수술 영상 분석을 위한 공유 인코더 다중 작업 학습에서의 다중 작업 수렴 문제를 해결한다.
  • 복잡하고 동적인 수술 환경에서 정확한 시각적 주의도 및 세분화를 위한 장거리 공간-시간 특징 학습을 향상시킨다.
  • 인간의 시각적 주의를 모방하는 임무 인식 시각적 주의도 맵과 스캔패스를 생성한다.
  • MICCAI 2017 로봇 기구 세분화 벤치마크에서 최신 기술 수준의 방법들을 능가한다.

제안 방법

  • 모델은 수술 기구 세분화와 시각적 주의도 탐지를 위한 두 개의 작업 전용 디코더를 갖춘 공유 인코더를 사용한다.
  • 비동기 공간-시간 최적화(ASOT)는 각 디코더에 대해 독립적인 기울기를 계산하여 공유 파rameter에도 불구하고 안정적인 다중 작업 수렴을 가능하게 한다.
  • 경쟁적 압축-흥신전(SC-scSE) 모듈은 스킵 연결을 활용해 공간적 및 채널별 특징을 동적으로 재조정함으로써 특징 표현을 향상시킨다.
  • ConvLSTM++는 연속 프레임의 고수준 인코더 특징을 연결하여 LSTM에 입력함으로써 장거리 시간적 의존성을 향상시킨다.
  • 스캔패스 추정 향상을 위해 계산 효율성을 유지하면서도 이종 손실을 조합하는 융합 손실을 사용한다. 이는 이진 교차 엔트로피(BCE)와 싱크호른 거리(Sd)를 조합한 것이다.
  • 모델은 MICCAI 2017 로봇 기구 세분화 데이터셋에서 훈련 및 평가되며, 시각적 주의도 성능 평가를 위해 SALICON에서도 검증된다.

실험 결과

연구 질문

  • RQ1공유 인코더 다중 작업 학습 프레임워크는 실시간으로 수술 기구 세분화와 임무 인식 시각적 주의도를 효과적으로 예측할 수 있는가?
  • RQ2세분화 및 시각적 주의도 작업 간 공유 파rameter 최적화 시 다중 작업 수렴을 어떻게 향상시킬 수 있는가?
  • RQ3장거리 공간-시간 의존성을 통합할 경우 스캔패스 예측 정확도는 어느 정도 향상되는가?
  • RQ4경쟁적 특징 재조정 메커니즘(SC-scSE)은 표준 압축-흥신전 모듈에 비해 모델 성능을 향상시킬 수 있는가?
  • RQ5BCE와 싱크호른 거리 손실의 융합은 수술 영상 분석에서 표준 손실 함수보다 더 나은 시각적 주의도 탐지 성능을 낼 수 있는가?

주요 결과

  • ST-MTL 모델은 MICCAI 2017 로봇 기구 세분화 도전 대회에서 전체 우승자보다 이중 세분화 및 유형 세분화 지표에서 모두 뛰어난 성능을 보였다.
  • ASOT는 다중 작업 수렴 문제를 효과적으로 해결하여 공유 인코더와 독립적 디코더 최적화를 통한 안정적인 훈련을 가능하게 하였다.
  • SC-scSE 모듈은 스킵 연결을 통해 강한 특징을 강조하고 약한 특징을 유지함으로써 특징의 구분력을 크게 향상시켰다.
  • ConvLSTM++는 장거리 시간적 모델링을 향상시켜 임무 중심의 시각적 주의도 및 스캔패스 예측에 측정 가능한 향상을 이끌었다.
  • BCE와 싱크호른 거리(Sd)를 융합한 손실은 높은 계산 효율성을 유지하면서도 배치-워싱턴 거리 손실보다 추론 속도에서 뛰어난 성능을 보였다.
  • SALICON 벤치마크에서 AUC-B(0.821), sAUC(0.752), CC(0.718)에서 경쟁력 있는 결과를 달성하여 정적 시각적 주의도 작업에 대한 강력한 일반화 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.