Skip to main content
QUICK REVIEW

[논문 리뷰] G-CASCADE: Efficient Cascaded Graph Convolutional Decoding for 2D Medical Image Segmentation

Md Mostafijur Rahman, Radu Mărculescu|arXiv (Cornell University)|2023. 10. 24.
Radiomics and Machine Learning in Medical Imaging인용 수 6
한 줄 요약

G-CASCADE는 계층적 비전 트랜스포머 인코더에서 유장된 장거리 상관관계를 유지하면서 특징 정제를 향상시키기 위해 계층적 그래프 컨volutional 어텐션 모듈을 사용하는 새로운 그래프 컨volutional 디코더를 제안한다. 다섯 개인 병리 영상 분할 벤치마크에서 SOTA인 CASCADE 디코더 대비 80.8% 적은 파라미터와 82.3% 적은 FLOPs를 기록하며 최신 기술 수준을 달성한다.

ABSTRACT

In recent years, medical image segmentation has become an important application in the field of computer-aided diagnosis. In this paper, we are the first to propose a new graph convolution-based decoder namely, Cascaded Graph Convolutional Attention Decoder (G-CASCADE), for 2D medical image segmentation. G-CASCADE progressively refines multi-stage feature maps generated by hierarchical transformer encoders with an efficient graph convolution block. The encoder utilizes the self-attention mechanism to capture long-range dependencies, while the decoder refines the feature maps preserving long-range information due to the global receptive fields of the graph convolution block. Rigorous evaluations of our decoder with multiple transformer encoders on five medical image segmentation tasks (i.e., Abdomen organs, Cardiac organs, Polyp lesions, Skin lesions, and Retinal vessels) show that our model outperforms other state-of-the-art (SOTA) methods. We also demonstrate that our decoder achieves better DICE scores than the SOTA CASCADE decoder with 80.8% fewer parameters and 82.3% fewer FLOPs. Our decoder can easily be used with other hierarchical encoders for general-purpose semantic and medical image segmentation tasks.

연구 동기 및 목표

  • 기존 디코더가 병리 영상 분할에서 장거리 공간적 상관관계를 유지하는 데에 한계가 있다는 문제를 해결하기 위해.
  • 트랜스포머 기반 아키텍처에서 정확도를 희생시키지 않고 계산 효율성을 향상시키기 위해.
  • 계층적 비전 트랜스포머에서 다중 척도 특징 정제를 향상시키는 새로운 그래프 컨볼루션 기반 디코더를 도입하기 위해.
  • G-CASCADE 디코더가 다양한 병리 영상 분할 작업에 걸쳐 일반화 가능한지를 입증하기 위해.

제안 방법

  • G-CASCADE는 계층적 비전 트랜스포머 인코더에서 유도된 다단계 특징을 점진적으로 정제하는 계층적 디코더 아키텍처를 사용한다.
  • 그래프 컨볼루션을 통해 공간 어텐션과 글로벌 수신장역할을 결합한 그래프 컨볼루션 어텐션 모듈(GCAM)을 도입하여 장거리 맥락을 유지한다.
  • 계산 비용을 줄이면서도 성능을 유지하는 데 효과적인 업컨볼루션 블록(UCB)을 사용한다.
  • 기본적인 3×3 컨볼루션 대신 그래프 컨볼루션 블록(GCB)을 사용하여 글로벌 특징 집합과 파라미터 수를 줄인다.
  • 성능과 계산 효율성의 균형을 맞추기 위해 스킵 커넥션을 덧셈 결합 방식으로 통합한다.
  • 다양한 공개 병리 영상 분할 데이터셋에서 교차 엔트로피 손실과 DICE 손실을 사용해 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1그래프 컨볼루션 기반 디코더가 2D 병리 영상 분할에서 컨벌루션 기반 디코더보다 장거리 상관관계를 더 잘 유지할 수 있는가?
  • RQ2제안된 G-CASCADE 디코더는 SOTA인 CASCADE 디코더와 비교해 정확도와 효율성 측면에서 어떻게 성능을 내는가?
  • RQ3GCAM 블록 내에서 그래프 컨볼루션과 공간 어텐션 모듈의 최적의 아키텍처 구성은 무엇인가?
  • RQ4G-CASCADE 디코더는 다양한 해부학적 구조와 병변 유형을 가진 다양한 병리 영상 분할 작업에 일반화 가능한가?
  • RQ5스킵 커넥션 통합 방식(덧셈 vs. 연결)의 선택이 성능과 계산 비용에 어떤 영향을 미치는가?

주요 결과

  • PVTv2-b2를 사용할 때 G-CASCADE는 Synapse 다기관 데이터셋에서 83.28%의 DICE 점수를 기록하여 베이스라인 CASCADE 디코더보다 0.5% 높은 성능을 내며, 파라미터 수는 80.8% 감소하고 FLOPs는 82.3% 감소시켰다.
  • GCB와 SPA 모듈을 모두 사용할 경우, 비계층적 베이스라인 대비 G-CASCADE 디코더는 DICE 점수에서 3.2% 향상되었다.
  • GCAM 내에서 GCB 다음에 SPA를 배치하는 구성이 반대로 배치하는 것보다 더 높은 성능을 보였으며, DICE 점수는 0.4% 높았다.
  • 스킵 커넥션의 덧셈 통합 방식은 연결 방식 대비 계산 비용을 60% 감소시켰으며, 성능는 유사하게 유지했다.
  • MERIT 백본을 사용할 경우, G-CASCADE는 4.27G FLOPs와 5.99M 파라미터로 84.63%의 DICE 점수를 기록하여 다섯 개의 벤치마크에서 SOTA 방법을 초월했다.
  • 제거 실험 결과, 계층적 아키텍처, GCB, SPA 모듈 각각이 성능 향상에 기여하며, 전체 구성이 가장 높은 DICE 점수를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.