Skip to main content
QUICK REVIEW

[논문 리뷰] SurgMAE: Masked Autoencoders for Long Surgical Video Analysis

Muhammad Abdullah Jamal, Omid Mohareri|arXiv (Cornell University)|2023. 05. 19.
Surgical Simulation and TrainingMedicine인용 수 3
한 줄 요약

SurgMAE는 장시간 수술 영상 분석을 위한 새로운 마스킹 오토인코더 프레임워크를 제안하며, 무작위 마스킹 대신 고스패ati오토럴 토큰을 샘플링하여 자기지도 학습 표현 학습을 향상시킨다. OR-AR 및 OR-ARv2 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 저데이터 환경에서 뛰어난 성능을 보이며, UCF-101로의 일반화 능력도 뛰어나, 기존 방법 대비 최대 1.3% mAP 및 0.9% 정확도 상위 1위 성능을 기록한다.

ABSTRACT

There has been a growing interest in using deep learning models for processing long surgical videos, in order to automatically detect clinical/operational activities and extract metrics that can enable workflow efficiency tools and applications. However, training such models require vast amounts of labeled data which is costly and not scalable. Recently, self-supervised learning has been explored in computer vision community to reduce the burden of the annotation cost. Masked autoencoders (MAE) got the attention in self-supervised paradigm for Vision Transformers (ViTs) by predicting the randomly masked regions given the visible patches of an image or a video clip, and have shown superior performance on benchmark datasets. However, the application of MAE in surgical data remains unexplored. In this paper, we first investigate whether MAE can learn transferrable representations in surgical video domain. We propose SurgMAE, which is a novel architecture with a masking strategy based on sampling high spatio-temporal tokens for MAE. We provide an empirical study of SurgMAE on two large scale long surgical video datasets, and find that our method outperforms several baselines in low data regime. We conduct extensive ablation studies to show the efficacy of our approach and also demonstrate it's superior performance on UCF-101 to prove it's generalizability in non-surgical datasets as well.

연구 동기 및 목표

  • 마스킹 오토인코더(MAE)가 비라벨링된 장시간 수술 영상에서 이식 가능한 표현을 학습할 수 있는지 조사한다.
  • MAE에서 무작위 마스킹의 한계를 해결하기 위해 정보가 풍부한 공간시계적 영역을 우선시하는 새로운 토큰 샘플링 전략을 제안한다.
  • 대규모 비라벨링 수술 영상에서 자기지도 사전학습을 활용하여 수술 활동 인식의 데이터 효율성을 향상시킨다.
  • 제안된 방법이 수술 및 비수술 영상 벤치마크 간에 일반화 가능한지 확인한다.

제안 방법

  • 장시간 수술 영상 표현 학습에 적합한 비전 트랜스포머 기반 마스킹 오토인코더인 SurgMAE를 제안한다.
  • 임베딩 공간 거리 기반으로 정보가 풍부한 영역을 선호하고 반복적이거나 배경 패치를 제거하는 고스패티오토럴 토큰 샘플링 전략을 도입한다.
  • 강건한 특징 학습을 유도하기 위해 높은 마스킹 비율(OR-AR에서는 90%, UCF-101에서는 80%)을 사용한다.
  • 가장자리 마스킹 토큰과 디코더 헤드를 사용하여 가시 토큰에서 마스킹된 패치를 재구성한다.
  • 개별 패치 정규화와 L2(SE) 손실을 적용하여 재구성 품질을 향상시킨다.
  • 다음 분류 작업에 대한 미세조정 전에 대규모 비라벨링 수술 영상 데이터셋(OR-ARv2, Cataract-101)에서 사전학습을 수행한다.

실험 결과

연구 질문

  • RQ1비라벨링된 장시간 수술 영상에서 마스킹 오토인코더가 효과적으로 이식 가능한 표현을 학습할 수 있는가?
  • RQ2수술 영상 MAE에서 무작위 마스킹이나 프레임/튜브 마스킹 대비 고스패티오토럴 토큰을 샘플링하여 마스킹할 경우 표현 학습 성능이 향상되는가?
  • RQ3SurgMAE는 완전 데이터 학습 대비 완전 지도 학습 및 대조 학습 기반 모델 대비 저데이터 환경에서 어떻게 성능을 내는가?
  • RQ4제안된 방법은 UCF-101과 같은 비수술 영상 데이터셋으로 일반화 가능한가?
  • RQ5다양한 마스킹 전략이 최종 수술 활동 인식 성능에 미치는 영향은 무엇인가?

주요 결과

  • SurgMAE는 라벨이 5%인 OR-AR에서 68.91% mAP를 기록하며, 모든 기준 모델보다 뛰어나며, 무작위 마스킹을 사용한 MAE(64.66%)와 Swin-B+BiGRU(완전 데이터 기반 95.13%)를 모두 초월한다.
  • 완전한 OR-ARv2 데이터셋에서 SurgMAE는 93.11% mAP를 달성하여, 다음으로 좋은 성능을 보인 모델(튜브 마스킹를 사용한 VideoMAE, 92.36%)을 뛰어넘었다.
  • UCF-101에서 SurgMAE는 92.1% 정확도 상위 1위 성능을 기록하며, 동일한 높은 마스킹 비율(80%)을 사용한 VideoMAE(91.2%)를 초월했다.
  • 제안된 고스패티오토럴 샘플링 전략은 모든 데이터셋에서 일관되게 성능 향상을 이끌어내어, 정보가 풍부한 토큰을 선택하는 데 효과적임을 확인했다.
  • 완전 데이터 미세조정 환경에서는 무작위 마스킹도 잘 작동하지만, SurgMAE의 장점은 특히 저데이터 환경에서 두드러지며, 뛰어난 데이터 효율성을 입증한다.
  • L2(SE) 손실을 사용한 개별 패치 정규화된 픽셀 재구성은 원본 픽셀 재구성보다 더 좋은 성능을 내며, 이는 이전 MAE 연구 결과와 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.