Skip to main content
QUICK REVIEW

[논문 리뷰] Temporally Constrained Neural Networks (TCNN): A framework for semi-supervised video semantic segmentation

Deepak Alapatt, Pietro Mascagni|arXiv (Cornell University)|2021. 12. 27.
Colorectal Cancer Screening and Detection인용 수 5
한 줄 요약

이 논문은 자동에코기반 시공간 정규화를 활용하여 제한된 애너테이션을 가진 수술 영상 데이터셋에서 성능을 햖थ하는, 반감독 학습 프레임워크인 시간 제약이 있는 신경망(TCNN)을 제안한다. 저차원 마스크 표현에서 유도된 전역 손실 및 일관성 손실을 도입함으로써 TCNN은 추론 비용을 증가시키지 않고도 희귀 클래스에 특히 유리한 분할 정확도를 향상시킨다. Endoscapes 데이터셋에서 Cystic Plate 클래스에 대해 최대 6.6%의 F1 점수 향상을 기록하였다.

ABSTRACT

A major obstacle to building models for effective semantic segmentation, and particularly video semantic segmentation, is a lack of large and well annotated datasets. This bottleneck is particularly prohibitive in highly specialized and regulated fields such as medicine and surgery, where video semantic segmentation could have important applications but data and expert annotations are scarce. In these settings, temporal clues and anatomical constraints could be leveraged during training to improve performance. Here, we present Temporally Constrained Neural Networks (TCNN), a semi-supervised framework used for video semantic segmentation of surgical videos. In this work, we show that autoencoder networks can be used to efficiently provide both spatial and temporal supervisory signals to train deep learning models. We test our method on a newly introduced video dataset of laparoscopic cholecystectomy procedures, Endoscapes, and an adaptation of a public dataset of cataract surgeries, CaDIS. We demonstrate that lower-dimensional representations of predicted masks can be leveraged to provide a consistent improvement on both sparsely labeled datasets with no additional computational cost at inference time. Further, the TCNN framework is model-agnostic and can be used in conjunction with other model design choices with minimal additional complexity.

연구 동기 및 목표

  • 미세한 해부학적 구조가 포함된 최소 침습 수술 절차에서 대규모이고 잘 애너테이션된 수술 영상 데이터셋의 부족 문제를 해결한다.
  • 제한된 애너테이션만 존재할 때도 수술 영상의 시간적 및 해부학적 제약 조건을 활용하여 분할 성능을 향상시킨다.
  • 추론 시 추가 계산 비용 없이도 기존 영상 의미 분할 모델을 향상시킬 수 있는 모델에 종속되지 않는 프레임워크를 개발한다.
  • 라파로스코픽 담낭절제술 및 백내장 수술과 같은 다양한 수술 절차에서 시각적 동적 특성과 해부학적 복잡성이 상이한 경우에도 일반화 가능성을 입증한다.

제안 방법

  • 예측된 분할 마스크의 저차원, 압축된 표현을 학습하기 위해 자동에코기반 모델을 사용하며, 이는 보조 신호 역할을 한다.
  • 재구성된 마스크와 원래 예측 마스크 간의 편차를 방지하는 전역 손실을 도입하여 구조적 일관성을 강제한다.
  • 연속 프레임 예측 간 변화를 최소화함으로써 시간적 안정성을 증진시키는 일관성 손실을 적용한다.
  • 백본 아키텍처에 종속되지 않는 플러그인 모듈로 자동에코기반 모델과 손실 구성 요소를 영상 의미 분할 파이프라인에 통합한다.
  • 검증 세트에서 초모수를 튜닝하여 교차 엔트로피 손실, 전역 손실, 일관성 손실의 조합으로 분할 네트워크를 엔드 투 엔드로 훈련한다.
  • 자기에코기의 버블넥 레이어를 활용해 압축된 특징을 추출하여 모델의 출력 공간을 정규화함으로써 노이즈 및 smok, 차폐와 같은 아티팩트에 대한 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1예측된 분할 마스크에 대한 자동에코기반 재구성은 반감독 영상 의미 분할에 효과적인 보조 신호가 될 수 있는가?
  • RQ2시간적 일관성과 전역 구조 정규화를 통합함으로써, 제한된 애너테이션을 가진 수술 영상 데이터셋에서 성능 향상 정도는 어느 정도인가?
  • RQ3TCNN 프레임워크는 다양한 시각적 동적 특성과 해부학적 복잡성을 지닌 다양한 수술 절차에 일반화되는가?
  • RQ4추론 시간이나 계산 비용을 증가시키지 않고도 희귀하거나 감지하기 어려운 해부학적 구조의 분할 성능을 향상시킬 수 있는가?

주요 결과

  • TCNN은 Endoscapes 및 CaDIS 데이터셋에서 Image Predictor 대비 평균 F1 점수를 각각 2.6%와 1.9% 향상시켰다.
  • 전역 손실 및 일관성 손실의 추가로 Endoscapes 및 CaDIS의 세 가지로 가장 적게 표현된 클래스에서 평균 F1 점수를 각각 4.3%와 1.4% 향상시켰다.
  • Endoscapes의 Cystic Plate 클래스는 Video Predictor 대비 6.6%의 F1 점수 향상을 기록하여 전역 구조 제약 조건의 강력한 효과를 보였다.
  • 전역 손실은 Endoscapes 및 CaDIS에서 Video Predictor의 F1 점수를 각각 1.48%와 0.32% 향상시켰지만, Image Predictor에서는 약간의 성능 저하를 보였으며, 이는 시간적 맥락이 있을 때 전역 손실의 효과가 더욱 두드러진다는 것을 시사한다.
  • 일관성 손실은 두 데이터셋 모두에서 일관된 성능 향상을 제공하며, 전역 손실과 상호보완적으로 작용한다.
  • 정성적 결과는 TCNN이 고립된 블롭이나 해부학적으로 비합리적인 구조와 같은 부자연스러운 예측를 감소시키며, 연속성과 연속성에 대한 강건성을 향상시킨다는 것을 보여주었다. 특히 연기나 차폐 상황에서도 우수한 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.