[논문 리뷰] Multi-Task Temporal Convolutional Networks for Joint Recognition of Surgical Phases and Steps in Gastric Bypass Procedures
이 논문은 내시경 영상을 사용하여 복강경 위절제술 절차에서 수술 단계와 단계를 동시 인식하기 위해 다중 작업 다단계 시간 컨volution 네트워크(MTMS-TCN)를 제안한다. 공유된 시간 표현을 활용한 다중 작업 학습을 통해 모델은 단일 작업 및 LSTM 기반 모델보다 단계 인식에서 1–2% 향상되었고, 계층적 annotation이 있는 새로운 Bypass40 데이터셋에서 단계 인식에서는 3–6% 향상되었다.
Purpose: Automatic segmentation and classification of surgical activity is crucial for providing advanced support in computer-assisted interventions and autonomous functionalities in robot-assisted surgeries. Prior works have focused on recognizing either coarse activities, such as phases, or fine-grained activities, such as gestures. This work aims at jointly recognizing two complementary levels of granularity directly from videos, namely phases and steps. Method: We introduce two correlated surgical activities, phases and steps, for the laparoscopic gastric bypass procedure. We propose a Multi-task Multi-Stage Temporal Convolutional Network (MTMS-TCN) along with a multi-task Convolutional Neural Network (CNN) training setup to jointly predict the phases and steps and benefit from their complementarity to better evaluate the execution of the procedure. We evaluate the proposed method on a large video dataset consisting of 40 surgical procedures (Bypass40). Results: We present experimental results from several baseline models for both phase and step recognition on the Bypass40 dataset. The proposed MTMS-TCN method outperforms in both phase and step recognition by 1-2% in accuracy, precision and recall, compared to single-task methods. Furthermore, for step recognition, MTMS-TCN achieves a superior performance of 3-6% compared to LSTM based models in accuracy, precision, and recall. Conclusion: In this work, we present a multi-task multi-stage temporal convolutional network for surgical activity recognition, which shows improved results compared to single-task models on the Bypass40 gastric bypass dataset with multi-level annotations. The proposed method shows that the joint modeling of phases and steps is beneficial to improve the overall recognition of each type of activity.
연구 동기 및 목표
- 복강경 위절제술 절차에서 다수 수준의 수술 활동 annotation의 부족을 해결하기 위해.
- 수술 단계와 단계를 동시에 인식하는 프레임워크를 개발하여 전반적인 워크플로우 이해를 향상시키기 위해.
- 시간 컨볼루션 네트워크를 활용한 다중 작업 학습의 효과성을 수술 영상 이해에 평가하기 위해.
- 40개의 annotation이 있는 영상과 11개의 단계/44개의 단계를 포함한 Bypass40 데이터셋을 사용하여 새로운 벤치마크를 수립하기 위해.
제안 방법
- 내시경 영상에서 수술 단계와 단계를 동시에 예측하는 다중 작업 다단계 시간 컨볼루션 네트워크(MTMS-TCN)를 제안한다.
- 각 단계에서 이전 단계의 예측을 확장하여 개선하는 다단계 아키텍처를 사용하며, 확장된 시간 컨볼루션을 적용한다.
- 시각적 특징 추출을 위해 공유된 CNN 기반(ResNet)을 사용하고, 단계 및 단계 분류를 위한 작업별 전용 헤드를 적용한다.
- 실시간 수술 모니터링에 적합한 순차적 예측을 가능하게 하기 위해 인과 컨볼루션을 적용한다.
- 공유된 특징과 작업별 손실을 사용하여 단계와 단계 간 상호보완적 관계를 활용하는 다중 작업 학습 설정을 구현한다.
- 4개의 교차 검증을 수행하고, Bypass40 데이터셋에서 정확도, 정밀도, 재현도 및 F1 점수를 사용하여 성능을 평가한다.
실험 결과
연구 질문
- RQ1단일 작업 학습과 비교해 수술 단계와 단계를 동시 모델링하면 성능 향상이 이루어지는가?
- RQ2LSTM 기반 모델과 비교해 다중 작업 시간 컨볼루션 네트워크는 미세한 수술 단계와 거친 단계를 인식하는 데 어떻게 비교되는가?
- RQ3다중 작업 학습이 짧은 지속 시간 또는 수술적으로 중요한 단계의 인식에 얼마나 기여하는가?
- RQ4단계와 단계 간의 계층적 관계가 모델의 일반화 능력 및 시간적 추론 능력 향상에 기여하는가?
주요 결과
- MTMS-TCN는 단계 인식에서 91.16%의 정확도를 달성하여 이어지는 최고 성능 모델(TeCNO)보다 2% 높게 기록하였다.
- 단계 인식에서 MTMS-TCN는 76.09%의 정확도를 기록하였으며, TeCNO보다 1% 높고, LSTM 기반 모델보다 정밀도 및 재현도에서 3–6% 향상되었다.
- 모델은 S25, S30, S39와 같이 다른 모델이 어려워하는 짧은 지속 시간의 단계를 잘 인식하는 데 기여하였다.
- MTMS-TCN의 동시 인식 정확도(75.14%)는 단계 인식 정확도와 매우 유사하여 계층적 관계를 효과적으로 모델링하고 있음을 시사한다.
- 다중 작업 설정은 두 작업 모두 성능 향상에 기여하였으며, MT-ResNet(기반 모델)은 단계 인식에서 ResNet보다 우수했고, 단계 정확도는 약간 감소하였다.
- 시각화 결과 MTMS-TCN가 TeCNO 및 ResNetLSTM보다 단계 전환과 작은 단계(P5, P7, P9)를 더 잘 포착하고 있음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.