Skip to main content
QUICK REVIEW

[논문 리뷰] LRTD: Long-Range Temporal Dependency based Active Learning for Surgical Workflow Recognition

Xueying Shi, Yueming Jin|arXiv (Cornell University)|2020. 04. 21.
Surgical Simulation and Training참고 문헌 28인용 수 6
한 줄 요약

이 논문은 수술 워크플로우 인식을 위한 새로운 주의적 학습 방법인 LRTD를 제안한다. LRTD는 비국소 순환 합성곱 신경망(NL-RCNet)을 통해 장거리 시간적 의존성을 모델링하여 정보성 있는 영상 클립을 선별한다. 클립의 내부 클립 의존도 점수를 기반으로 순위를 매기며, 이는 낮은 내부 클립 의존도 점수(정보량이 더 높은 것으로 간주됨)를 가진 클립을 선별함으로써 전체 데이터셋의 50%만으로도 뛰어난 성능을 달성한다. 이는 Cholec80 데이터셋에서 완전히 지도 학습한 결과와 최신 주의적 학습 기준보다도 뛰어나다.

ABSTRACT

Automatic surgical workflow recognition in video is an essentially fundamental yet challenging problem for developing computer-assisted and robotic-assisted surgery. Existing approaches with deep learning have achieved remarkable performance on analysis of surgical videos, however, heavily relying on large-scale labelled datasets. Unfortunately, the annotation is not often available in abundance, because it requires the domain knowledge of surgeons. In this paper, we propose a novel active learning method for cost-effective surgical video analysis. Specifically, we propose a non-local recurrent convolutional network (NL-RCNet), which introduces non-local block to capture the long-range temporal dependency (LRTD) among continuous frames. We then formulate an intra-clip dependency score to represent the overall dependency within this clip. By ranking scores among clips in unlabelled data pool, we select the clips with weak dependencies to annotate, which indicates the most informative ones to better benefit network training. We validate our approach on a large surgical video dataset (Cholec80) by performing surgical workflow recognition task. By using our LRTD based selection strategy, we can outperform other state-of-the-art active learning methods. Using only up to 50% of samples, our approach can exceed the performance of full-data training.

연구 동기 및 목표

  • 수술 영상 데이터셋의 높은 레이블링 비용 문제를 해결하기 위해 전문 지식이 필요하고 시간이 오래 걸리는 레이블링 과정을 줄이기 위해.
  • 국소 프레임 수준의 불확실성 이상의 장거리 시간적 의존성을 활용하여 수술 영상 분석에서의 주의적 학습을 향상시키기 위해.
  • 레이블링 작업을 줄이면서도 완전히 지도 학습한 성능을 유지하거나 초월하기 위해.
  • 내부 클립 의존도가 약한 클립을 가장 정보성 있는 것으로 간주하고 모델 훈련에 가장 적합한 자료로 우선순위를 정하는 데이터 선택 전략을 개발하기 위해.
  • 대규모 공개 수술 데이터셋(Cholec80)에서 방법을 검증하고, 비용 효율적인 영상 분석을 위한 임상적 잠재력을 입증하기 위해.

제안 방법

  • 비국소 블록을 통합하여 영상 클립의 프레임 간 장거리 시간적 의존성을 모델링하는 비국소 순환 합성곱 신경망(NL-RCNet)을 제안한다.
  • 크로스-프레임 어텐션 가중치를 기반으로 각 클립 내부의 전체 시간적 일관성을 측정하는 내부 클립 의존도 점수를 도입한다.
  • 내부 클립 의존도 점수가 낮은 클립(정보량이 더 많다고 간주됨)을 우선순위로 선별하여 레이블링 대상으로 선정한다.
  • 내부 클립 의존도 점수가 낮은 클립을 우선순위로 정렬하기 위한 랭킹 메커니즘을 사용하며, 이는 더 다양한 또는 모호한 시간 패턴을 포함하고 있다고 가정한다.
  • 선택된 클립을 사용하여 반복적으로 딥 러닝 모델을 훈련하며, 각 주의적 학습 반복 단계에서 모델을 업데이트한다.
  • 장기 기억 단위(LSTM)를 활용한 순환 아키텍처를 사용하여 수술 클립의 순차적 동역학을 모델링하고, 장거리 모델링을 위해 비국소 연산을 통합한다.

실험 결과

연구 질문

  • RQ1장거리 시간적 의존성을 모델링하면 주의적 학습에서 선택된 수술 영상 클립의 정보성 향상에 기여하는가?
  • RQ2내부 클립 의존도 점수가 낮은 클립을 선별하는 것이 국소 프레임 관계나 프레임 수준의 불확실성에 기반한 기존 방법보다 더 뛰어난 모델 성능을 낳는가?
  • RQ3전반적인 시간적 일관성에 기반한 데이터 선택 전략이 오직 인접 프레임 정보에 의존하는 최신 주의적 학습 방법보다 우수한 성능을 낼 수 있는가?
  • RQ4LRTD는 얼마나 많은 레이블링 비용을 줄일 수 있으며, 완전히 지도 학습한 성능을 유지하거나 초월할 수 있는가?
  • RQ5LRTD 기반 클립 선별이 복잡한 전환을 보이는 수술 단계에서 성능에 어떤 영향을 미치는가?

주요 결과

  • LRTD 방법은 Cholec80 데이터셋에서 전체 데이터의 50%만 레이블링된 상태에서도 완전히 지도 학습한 결과를 초월하는 뛰어난 성능을 달성한다.
  • 모든 레이블링 비율에서 정확도, 재현율, F1 점수, Jaccard 점수 모두에서 LRTD가 일관되게 향상되며, 변동이 거의 없고 안정적인 성능을 보인다.
  • 모든 데이터 비율에서 정확도, Jaccard 점수, F1 점수, 재현율 측면에서 최신 DBN 기반 주의적 학습 방법보다 뛰어난 성능을 보인다.
  • Phase 1(43.0%)과 Phase 4(27.5%)에서 선택된 클립이 가장 빈번히 나타나며, 이는 더 길거나 더 복잡한 단계가 모델 학습에 더 큰 기여를 한다는 것을 시사한다.
  • 시각화 결과는 선택된 클립이 낮은 의존도 점수(어두운 행렬)를 가지며, 시간적 일관성이 약하고 정보량이 많다는 것을 확인한다. 반면 선택되지 않은 클립는 강한 균일한 의존도를 보인다.
  • 이 방법은 안정성과 강건성을 보이며, 정밀도와 재현율에 대한 변동이 거의 없으며, DBN과 달리 재현율에 불안정성이 없어 더 나은 데이터 분포 제어 능력을 가짐을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.