[논문 리뷰] nnFormer: Interleaved Transformer for Volumetric Segmentation
nnFormer은 부피형 의료 영상 분할을 위한 3D 트랜스포머로, 컨볼루션과 자체 어텐션을 교대로 배열하고, 로컬 및 글로벌 볼륨 기반 자기 주의에 의존하며, nnUNet을 다수의 데이터셋에서 능가하기 위해 스킵 어텐션을 도입한다.
Transformer, the model of choice for natural language processing, has drawn scant attention from the medical imaging community. Given the ability to exploit long-term dependencies, transformers are promising to help atypical convolutional neural networks to overcome their inherent shortcomings of spatial inductive bias. However, most of recently proposed transformer-based segmentation approaches simply treated transformers as assisted modules to help encode global context into convolutional representations. To address this issue, we introduce nnFormer, a 3D transformer for volumetric medical image segmentation. nnFormer not only exploits the combination of interleaved convolution and self-attention operations, but also introduces local and global volume-based self-attention mechanism to learn volume representations. Moreover, nnFormer proposes to use skip attention to replace the traditional concatenation/summation operations in skip connections in U-Net like architecture. Experiments show that nnFormer significantly outperforms previous transformer-based counterparts by large margins on three public datasets. Compared to nnUNet, nnFormer produces significantly lower HD95 and comparable DSC results. Furthermore, we show that nnFormer and nnUNet are highly complementary to each other in model ensembling.
연구 동기 및 목표
- 로컬 컨볼루션 바이어스를 넘어서는 장거리 의존성을 포착하기 위해 부피형 의료 영상 분할에 트랜스포머를 활용하도록 동기를 부여한다.
- 공간 정밀도와 계층적 표현을 보존하기 위해 합성곱 임베딩과 트랜스포머 블록을 교대로 배치한 하이브리드 스템을 개발한다.
- 효율성과 수용영역의 균형을 맞추기 위해 로컬 볼륨 기반(LV-MSA) 및 글로벌 볼륨 기반(GV-MSA) 자기 주의를 제안한다.
- U-Net 유사 구조에서 스킵 연결을 개선하기 위한 스킵 어텐션을 도입한다.
- nnFormer가 트랜스포머 기반 기본 모델보다 우수한 분할 성능을 달성하고 모델 앙상블에서 nnUNet을 보완한다는 것을 입증한다.
제안 방법
- 픽셀 수준의 공간 정보를 보존하기 위해 경량 합성곱 임베딩 레이어로 3D 의학 영상을 임베딩한다.
- LV-MSA(로컬 3D 자기 주의)와 합성곱 하향 샘플링을 결합한 교차 인코더 블록을 사용하여 다중 스케일 특징을 구축한다.
- 병목에서 GV-MSA를 활용하여 계산량을 줄이면서 큰 수용필드를 제공한다.
- 인코더와 디코더 특징을 융합하기 위해 업샘플링과 스킵 어텐션을 사용한 대칭 구조로 디코딩한다.
- 전통적인 스킵 연결을 스킵 어텐션으로 대체하여 인코더와 디코더 간 정보 흐름을 개선한다.
- 여러 해상도에서의 공동 손실과 함께 다수의 디코더 단계에서 심층 감독으로 학습한다.
실험 결과
연구 질문
- RQ1교대로 구성된 컨볼루션 및 자기 주의 블록을 가진 3D 트랜스포머가 순수 CNN 기반 모델이나 표준 트랜스포머 기반 모델보다 부피 분할을 개선할 수 있는가?
- RQ2로컬 및 글로벌 볼륨 기반 자기 주의(LV-MSA 및 GV-MSA)가 다중 스케일 부피 표현 학습에 보완적 이점을 제공하는가?
- RQ3스킵 어텐션이 3D 분할을 위한 U-Net 유사 구조에서 정보 전달을 향상시키는가?
- RQ4뇌종양, 다기관 및 심장 분할 작업에서 nnFormer가 nnUNet 및 다른 트랜스포머 기반 모델과 어떻게 비교되는가?
주요 결과
- nnFormer는 세 개의 공개 데이터셋에서 이전의 트랜스포머 기반 방법들에 비해 현저히 개선된다.
- nnUNet과 비교할 때 nnFormer는 HD95가 더 낮고 DSC는 동등하거나 더 우수하다.
- nnFormer와 nnUNet의 결합은 평균 앙상블에서 보완적인 이점을 제공한다.
- 특성 다양성 제거 실험은 교대로 배치된 conv+트랜스포머 스템, LV-MSA/GV-MSA 및 스킵 어텐션이 분할 성능 향상에 효과적임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.