Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Convolutional LSTM Approach for Tool Tracking in Laparoscopic Videos

Chinedu Innocent Nwoye, Didier Mutter|arXiv (Cornell University)|2018. 12. 04.
Surgical Simulation and Training참고 문헌 28인용 수 6
한 줄 요약

이 논문은 공간 경계상자 또는 세그멘테이션 레이블과 같은 고비용의 공간 레이블이 아닌 이진 존재 레이블만을 사용하여 복강경 영상에서 수술 기구 추적을 위한 약한 감독 기반 ConvLSTM 방법을 제안한다. 시간-공간 일관성을 활용하여 국소화 히트맵을 매끄럽게 하는 ConvLSTM을 통해, 완전히 감독된 기준 모델 대비 12.6% 높은 MOTA, 13.9% 향상된 국소화 정확도, 5.0% 높은 mAP를 달성한다. 이는 수술 영상 분석에서 희박하고 고비용인 공간 레이블 문제를 해결하는 데 기여한다.

ABSTRACT

Purpose: Real-time surgical tool tracking is a core component of the future intelligent operating room (OR), because it is highly instrumental to analyze and understand the surgical activities. Current methods for surgical tool tracking in videos need to be trained on data in which the spatial positions of the tools are manually annotated. Generating such training data is difficult and time-consuming. Instead, we propose to use solely binary presence annotations to train a tool tracker for laparoscopic videos. Methods: The proposed approach is composed of a CNN + Convolutional LSTM (ConvLSTM) neural network trained end-to-end, but weakly supervised on tool binary presence labels only. We use the ConvLSTM to model the temporal dependencies in the motion of the surgical tools and leverage its spatio-temporal ability to smooth the class peak activations in the localization heat maps (Lh-maps). Results: We build a baseline tracker on top of the CNN model and demonstrate that our approach based on the ConvLSTM outperforms the baseline in tool presence detection, spatial localization, and motion tracking by over 5.0%, 13.9%, and 12.6%, respectively. Conclusions: In this paper, we demonstrate that binary presence labels are sufficient for training a deep learning tracking model using our proposed method. We also show that the ConvLSTM can leverage the spatio-temporal coherence of consecutive image frames across a surgical video to improve tool presence detection, spatial localization, and motion tracking. keywords: Surgical workflow analysis, tool tracking, weak supervision, spatio-temporal coherence, ConvLSTM, endoscopic videos

연구 동기 및 목표

  • 수술 영상 분석에서 희박하고 고비용인 공간 레이블 문제를 해결하기 위해, 오직 이진 존재 레이블만을 사용하여 학습이 가능하도록 하는 것.
  • 완전히 감독된 국소화 데이터에 의존하지 않고도 복강경 영상에서 수술 기구 추적 성능을 향상시키는 것.
  • 약한 감독 환경에서 영상 프레임 간 시간적 일관성을 활용하여 탐지, 국소화 및 궤적 매끄러움을 향상시키는 것.
  • 약한 감독 하에 탐지, 국소화 및 추적을 통합한 완전한 엔드 투 엔드 학습이 가능한 모델을 개발하는 것.

제안 방법

  • 스패티오-타임리얼 의존성을 모델링하기 위해 CNN 백본과 ConvLSTM을 조합한 완전 컨볼루션 신경망 아키텍처를 사용한다.
  • 경계상자 또는 세그멘테이션 앤오테이션 없이, 오직 이미지 수준의 이진 레이블(기구 존재 여부)만을 사용하여 엔드 투 엔드로 학습한다.
  • 최종 레이어 활성화에서 생성된 국소화 히트맵(Lh-maps)이 시간에 따라 ConvLSTM에 의해 매끄럽게 개선되어 공간 국소화 정확도가 향상된다.
  • ConvLSTM은 연속된 프레임 간 특징 표현을 전파함으로써 시간적 일관성을 학습하여 탐지 안정성과 궤적 일관성을 향상시킨다.
  • 성능 평가를 위해 Cholec80 데이터셋을 사용하여 약한 감독 설정에서 평가하며, MOTA, 평균 국소화 정확도, 존재 탐지에 대한 mAP로 측정한다.
  • 시간적 정제가 국소화 이전에 이루어지는 변형 아키텍처(R+CL+C)를 탐색하였으며, 이는 특징 맵의 의미적 일관성을 유지함으로써 우수한 성능을 달성한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 공간 감독 없이 오직 이진 존재 레이블만을 사용하여 복강경 영상에서 수술 기구 추적을 안정적으로 수행할 수 있는가?
  • RQ2ConvLSTM이 약한 감독 환경에서 시간적 일관성을 얼마나 효과적으로 활용하여 국소화 및 추적 성능을 향상시킬 수 있는가?
  • RQ3시간 정제(ConvlSTM)와 국소화(분류 헤드)의 순서가 최종 추적 및 국소화 정확도에 영향을 미치는가?
  • RQ4재학습 없이도 다양한 프레임 레이트(예: 1fps에서 25fps) 간에 일반화 가능한가?
  • RQ5약한 감독 모델이 생성한 국소화 히트맵이 실제 기구 경계를 얼마나 잘 근사하거나, 세그멘테이션 작업으로 확장 가능한가?

주요 결과

  • 제안된 ConvLSTM 기반 방법은 기준 모델 대비 MOTA를 12.6% 향상시켜, 약한 감독 하에서 다중 객체 추적 성능 향상이 뚜렷하게 입증되었다.
  • 국소화 정확도가 13.9% 향상되어, 오직 이진 레이블만을 사용함에도 불구하고 수술 기구의 공간 경계를 더 잘 식별함을 시사한다.
  • 기구 존재 탐지에 대한 mAP가 5.0% 향상되어, 프레임 간 기구 존재 여부 탐지 신뢰도가 향상됨을 보여준다.
  • R+CL+C 아키텍처가 다른 구성보다 뛰어난 성능을 보이며, 시간 정제를 국소화 이전에 수행함으로써 공간 의미적 일관성이 유지되고 성능 향상이 이루어짐을 확인한다.
  • 모델는 다양한 프레임 레이트 간에 잘 일반화되며, 1fps 데이터로 학습된 모델이 25fps 영상에서도 기구를 성공적으로 추적함을 보여, 시간적 일반화 능력이 뛰어나다는 것을 시사한다.
  • 정성적 결과로 국소화 히트맵이 기구 끝부분을 약하지만 타당하게 세그멘테이션하는 경향을 보이며, 향후 인스턴스 세그멘테이션 작업으로의 확장 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.