[논문 리뷰] TEC-Net: Vision Transformer Embrace Convolutional Neural Networks for Medical Image Segmentation
TEC-Net는 동적 변형 가능 컨볼루션(DDConv)을 컨볼루션 신경망 브랜치에 통합하여 적응형 국소 특징 추출을 가능하게 하고, 트랜스포머 브랜치에 새로운(이동된)-윈도우 적응형 보완 주의 모듈((S)W-ACAM)을 도입하여 다차원 장거리 의존성을 모델링하는 하이브리드 의료 영상 분할 네트워크를 제안한다. 이 방법은 사전 훈련 없이도 더 적은 파라미터 수와 추론 비용으로 최신 기술 수준(SOTA) 성능을 달성한다.
The hybrid architecture of convolution neural networks (CNN) and Transformer has been the most popular method for medical image segmentation. However, the existing networks based on the hybrid architecture suffer from two problems. First, although the CNN branch can capture image local features by using convolution operation, the vanilla convolution is unable to achieve adaptive extraction of image features. Second, although the Transformer branch can model the global information of images, the conventional self-attention only focuses on the spatial self-attention of images and ignores the channel and cross-dimensional self-attention leading to low segmentation accuracy for medical images with complex backgrounds. To solve these problems, we propose vision Transformer embrace convolutional neural networks for medical image segmentation (TEC-Net). Our network has two advantages. First, dynamic deformable convolution (DDConv) is designed in the CNN branch, which not only overcomes the difficulty of adaptive feature extraction using fixed-size convolution kernels, but also solves the defect that different inputs share the same convolution kernel parameters, effectively improving the feature expression ability of CNN branch. Second, in the Transformer branch, a (shifted)-window adaptive complementary attention module ((S)W-ACAM) and compact convolutional projection are designed to enable the network to fully learn the cross-dimensional long-range dependency of medical images with few parameters and calculations. Experimental results show that the proposed TEC-Net provides better medical image segmentation results than SOTA methods including CNN and Transformer networks. In addition, our TEC-Net requires fewer parameters and computational costs and does not rely on pre-training. The code is publicly available at https://github.com/SR0920/TEC-Net.
연구 동기 및 목표
- 표준 컨볼루션 신경망에서 의료 영상 분할에 대해 고정된 수신장과 파라미터 공유의 한계를 해결하기 위해.
- 의료 영상에 사용되는 트랜스포머에서 전통적인 자기주도 주의 메커니즘에서 채널 및 다차원 주의가 간과되는 문제를 해결하기 위해.
- 소규모 의료 데이터셋에서 높은 분할 정확도를 유지하면서 모델 복잡성을 줄이고 사전 훈련에 대한 의존도를 제거하기 위해.
- 의료 영상 분할에서 CNN과 트랜스포머 브랜치를 효과적으로 통합하여 국소적 특징과 전역적 특징 학습의 보완을 이루기 위해.
제안 방법
- 작업에 적합한 특징 추출을 가능하게 하기 위해, 공간적으로 변하는 커널 가중치와 오프셋을 학습하는 동적 변형 가능 컨볼루션(DDConv)을 컨볼루션 브랜치에 도입한다.
- 공간, 채널 및 다차원 주의를 동시에 모델링할 수 있도록 트랜스포머 브랜치에 (S)W-ACAM 모듈을 제안하여 장거리 의존성 모델링을 향상시킨다.
- 트랜스포머 인코더에서 계산 비용과 파라미터 수를 줄이기 위해 압축된 컨볼루션 투영 레이어를 사용한다.
- 모델 크기를 줄이고 사전 훈련 의존도를 제거하기 위해 트랜스포머 피드포워드 네트워크의 표준 MLP 대신 학습 가능한 파라미터 모듈(LPM)을 사용한다.
- CNN 및 트랜스포머 브랜치의 특징를 융합하기 위해 스킵 연결을 갖춘 이중 브랜치 U-모양 인코더-디코더 아키텍처를 설계하여 국소화 및 분할 성능을 향상시킨다.
- 다중 척도 특징 융합과 깊은 네트워크 레이어를 통한 점진적 정밀화를 적용하여 윤곽선과 객체 경계 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1표준 컨볼루션에 비해 동적 변형 가능 컨볼루션은 의료 영상 분할에서 국소 특징 표현을 향상시키는가?
- RQ2트랜스포머에서 공간-채널 다차원 주의를 모델링하면 저대비 및 노이즈가 많은 복잡한 의료 영상의 분할 성능이 향상되는가?
- RQ3하이브리드 CNN-Transformer 아키텍처는 더 적은 파라미터 수와 낮은 계산 비용으로 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?
- RQ4표준 MLP를 학습 가능한 파라미터 모듈(LPM)으로 대체함으로써 사전 훈련이 필요 없어지는 정도는 어느 정도인가?
- RQ5CNN 및 트랜스포머 브랜치의 통합은 의료 영상 분할에서 국소 세부 정보 유지와 전역적 맥락 모델링을 어떻게 향상시키는가?
주요 결과
- TEC-Net은 ISIC2018 데이터셋에서 90.72%의 Dice 스코어를 기록하여 Swin-Unet 및 U-Net 변종을 포함한 기존 SOTA 방법들을 능가한다.
- 절단 실험 결과에서 DDConv, (S)W-ACAM, LPM을 모두 통합할 경우 최고의 성능을 기록하며, 이때 Dice 스코어는 90.88%에 이른다.
- TEC-Net은 모델 파라미터를 11.58M으로 줄여, U-Net+Swin-Unet 기준선의 46.92M보다 크게 감소시켜 높은 파라미터 효율성을 입증한다.
- 사전 훈련 없이도 높은 정확도를 달성하며, LPM만 사용했을 경우 88.43%의 Dice 스코어, (S)W-ACAM과 LPM을 함께 사용했을 경우 89.46%의 스코어를 기록하여 소규모 데이터셋에서의 강건성을 입증한다.
- 시각화 결과는 디코더에서 특징 융합을 통해 목표 영역에 점차적으로 집중하면서 분할을 정밀하게 개선하는 것을 확인했으며, 특히 경계 및 윤곽 세부 정보에서 뚜렷한 향상이 있었다.
- (S)W-ACAM 모듈은 다차원 의존성을 효과적으로 포착하며, 병변 경계 및 장기 구조에 집중된 개선된 주의 맵을 통해 이를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.