Skip to main content
QUICK REVIEW

[논문 리뷰] LAPFormer: A Light and Accurate Polyp Segmentation Transformer

Mai Thanh Thi Nguyen, Tung Thanh Bui|arXiv (Cornell University)|2022. 10. 10.
Radiomics and Machine Learning in Medical Imaging인용 수 7
한 줄 요약

LAPFormer은 계층적 Transformer 인코더와 새로운 CNN 디코더를 결합한 경량이며 정확한 Transformer 기반 모델로, 점진적 특징 융합, 특징 정제 및 선택 모듈을 특징으로 한다. 이는 CVC-ColonDB에서 최고 성능을 기록하고, 다섯 가지 벤치마크에서 경쟁력 있는 결과를 내며 기존의 Transformer 기반 방법들보다 훨씬 낮은 FLOPs와 파라미터 수를 확보한다.

ABSTRACT

Polyp segmentation is still known as a difficult problem due to the large variety of polyp shapes, scanning and labeling modalities. This prevents deep learning model to generalize well on unseen data. However, Transformer-based approach recently has achieved some remarkable results on performance with the ability of extracting global context better than CNN-based architecture and yet lead to better generalization. To leverage this strength of Transformer, we propose a new model with encoder-decoder architecture named LAPFormer, which uses a hierarchical Transformer encoder to better extract global feature and combine with our novel CNN (Convolutional Neural Network) decoder for capturing local appearance of the polyps. Our proposed decoder contains a progressive feature fusion module designed for fusing feature from upper scales and lower scales and enable multi-scale features to be more correlative. Besides, we also use feature refinement module and feature selection module for processing feature. We test our model on five popular benchmark datasets for polyp segmentation, including Kvasir, CVC-Clinic DB, CVC-ColonDB, CVC-T, and ETIS-Larib

연구 동기 및 목표

  • 내시경 영상에서 형태, 크기, 외관에 따라 높은 변동성을 보이는 폴립 분할 문제를 해결하기 위해.
  • Transformer의 전역적 맥락 모델링 능력을 활용하여 일반화 능력과 분할 정확도를 향상시키기 위해.
  • 기존의 Transformer 기반 모델들과 비교해 계산 복잡도를 낮추면서도 높은 성능을 유지하기 위해.
  • 다중 척도 특징 융합 및 정제 모듈을 통해 경계 검출 및 세밀한 분할 성능을 향상시키기 위해.
  • 실시간 폴립 검출 시스템에서 임상적 적용에 적합한 경량이면서도 정확한 아키텍처 개발을 위해.

제안 방법

  • LAPFormer은 입력 내시경 영상에서 전역적 맥락적 특징을 추출하기 위해 계층적 Transformer 인코더를 사용한다.
  • 새로운 CNN 기반 디코더는 인코더의 다양한 단계에서 유도된 다중 척도 특징을 융합하기 위해 점진적 특징 융합(PFF) 모듈을 통합한다.
  • 디코더에는 융합 이전에 특징 품질을 향상시키는 특징 정제 모듈(FRM)과 관련성에 따라 특징을 적응적으로 가중하는 특징 선택 모듈(FSM)이 포함되어 있다.
  • 공간적 세부 정보를 유지하고 경계 국소화를 향상시키기 위해 저수준의 스킵 연결을 통합한다.
  • 주의 히트맵과 특징 중요도 분석을 위해 평균 풀링과 Grad-CAM 시각화를 사용한다.
  • 모델는 다섯 개인 공개 폴립 분할 데이터셋에서 표준 분할 손실 함수를 사용해 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1하이브리드 Transformer-CNN 아키텍처가 낮은 계산 비용을 유지하면서도 우수한 폴립 분할 성능을 달성할 수 있는가?
  • RQ2점진적 특징 융합이 다중 척도 특징을 폴립 분할에 효과적으로 융합하는 데 얼마나 유용한가?
  • RQ3특징 정제 및 선택 모듈이 분할 정확도와 경계 검출에 얼마나 기여하는가?
  • RQ4저수준 특징 통합이 모델의 폴립 경계 국소화 능력에 실제로 중요한가?
  • RQ5기존의 최고 성능을 기록하는 Transformer 기반 모델들과 비교해 LAPFormer은 표준 폴립 분할 벤치마크에서 성능과 효율성 측면에서 어떻게 뛰어나게 되는가?

주요 결과

  • LAPFormer-S는 Kvasir 데이터셋에서 평균 Dice 스코어 0.910과 평균 IoU 0.857을 기록하여 효율성 측면에서 여러 최고 성능(SOTA) 방법들을 능가한다.
  • CVC-ColonDB에서 LAPFormer-L은 평균 Dice 스코어 0.815와 평균 IoU 0.735를 기록하여 새로운 최고 성능을 수립한다.
  • LAPFormer-L는 단지 18.96 GFLOPs와 47.22M 파라미터를 가지며, ColonFormer-L(22.94 GFLOPs, 52.94M 파라미터) 및 기타 SOTA 모델들보다 크게 낮다.
  • 특징 선택 모듈(FSM)은 모든 데이터셋에서 성능 향상을 이끌었으며, ETIS-Larib에서 가장 큰 성과를 기록했다(mDice +0.029, mIoU +0.033).
  • 저수준 스킵 연결을 추가함으로써 경계 분할 성능이 일관되게 향상되었으며, 일부 데이터셋에서는 mDice가 최대 0.025 증가했다.
  • 절단 실험 결과, 점진적 특징 융합 및 정제 모듈이 최적의 성능을 내기 위해 필수적임을 확인하였으며, 각 구성 요소가 최종 분할 품질에 크게 기여하고 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.