Skip to main content
QUICK REVIEW

[논문 리뷰] TranSiam: Fusing Multimodal Visual Features Using Transformer for Medical Image Segmentation

Xuejian Li, Shiqiang Ma|arXiv (Cornell University)|2022. 04. 26.
Advanced Neural Network Applications인용 수 15
한 줄 요약

TranSiam는 다중모odal 의료 영상 분할을 위한 2D 이중경로 트랜스포머-CNN 네트워크를 제안하며, 크로스- 및 세밀한 주의를 조합하는 새로운 TMM 블록을 통해 특징을 융합한다. BraTS 2019 및 2020에서 최신 기술 성능을 달성하여 딱도 스코어 89.26%와 HD95 4.77을 기록하며, CNN 및 순수 트랜스포머를 모두 능가하지만 파rameter 수는 단지 7.98M에 불과하다.

ABSTRACT

Automatic segmentation of medical images based on multi-modality is an important topic for disease diagnosis. Although the convolutional neural network (CNN) has been proven to have excellent performance in image segmentation tasks, it is difficult to obtain global information. The lack of global information will seriously affect the accuracy of the segmentation results of the lesion area. In addition, there are visual representation differences between multimodal data of the same patient. These differences will affect the results of the automatic segmentation methods. To solve these problems, we propose a segmentation method suitable for multimodal medical images that can capture global information, named TranSiam. TranSiam is a 2D dual path network that extracts features of different modalities. In each path, we utilize convolution to extract detailed information in low level stage, and design a ICMT block to extract global information in high level stage. ICMT block embeds convolution in the transformer, which can extract global information while retaining spatial and detailed information. Furthermore, we design a novel fusion mechanism based on cross attention and selfattention, called TMM block, which can effectively fuse features between different modalities. On the BraTS 2019 and BraTS 2020 multimodal datasets, we have a significant improvement in accuracy over other popular methods.

연구 동기 및 목표

  • 낮은 자료량의 의료 영상 분석에서 CNN의 국소적 특징 추출 한계와 트랜스포머의 세밀한 세부 정보 손실 문제를 해결하기 위해.
  • 다양한 영상 모odal 간 시각적 특징을 효과적으로 융합하여 다중모달 의료 영상 분할 성능을 향상시키기 위해.
  • 컨볼루션과 자기주의 기반 메커니즘의 장점을 결합한 경량이며 파rameter 효율적인 아키텍처를 설계하기 위해.
  • 모달 특화 특징 간 격차를 줄이고 융합 과정에서의 다중모달 특징 정렬을 향상시키기 위해.

제안 방법

  • TranSiam는 모달 특화 특징을 추출하기 위해 이중경로 인코더를 사용하며, 저수준 특징에는 표준 컨볼루션을, 고수준 전역 표현에는 ICMT 블록을 활용한다.
  • ICMT 블록은 깊이 분리형 컨볼루션을 자기주의 메커니즘에 통합하여 공간적 정보와 세부 정보를 유지하면서도 전역적 맥락 모델링을 가능하게 한다.
  • 새로운 TMM(트랜스포머 기반 다중모달) 융합 블록은 크로스-주의와 자기주의를 사용하여 이중 모달 간 상관관계를 모델링하고 고수준 레이어에서 특징을 융합한다.
  • 네트워크는 스위프 연결을 갖춘 U-Net 유사 디코더를 사용하여 융합된 고수준 특징을 통합하여 정밀한 분할을 수행한다.
  • 트랜스포머의 표준 선형 투영 및 MLP를 깊이 분리형 컨볼루션과 3×3 잔여 블록으로 대체하여 파rameter 효율성과 세부 정보 유지 성능을 향상시킨다.
  • 공정한 비교를 위해 BraTS 2019 및 2020 데이터셋에서 앙상블 또는 후처리 없이 학습을 수행한다.

실험 결과

연구 질문

  • RQ1하이브리드 CNN-트랜스포머 아키텍처는 자원이 제한된 의료 영상 분할에서 국소 세부 정보와 전역 맥락을 효과적으로 포착할 수 있는가?
  • RQ2다양한 영상 순서에서 유도된 다중모달 시각적 특징은 어떻게 효과적으로 융합할 수 있으며, 모달 특화 정보를 유지할 수 있는가?
  • RQ3컨볼루션 인덕티브 바이어스를 가진 경량 트랜스포머 변종은 표준 트랜스포머 및 CNN보다 다중모달 분할에서 뛰어난 성능을 낼 수 있는가?
  • RQ4고수준 레이어에서만 특징을 융합하면 모달 특화 간섭을 줄이고 분할 정확도를 향상시킬 수 있는가?

주요 결과

  • TranSiam는 BraTS 2019 검증 세트에서 딱도 유사도 스코어 89.26%를 기록하여 3D U-Net, V-Net, TransBTS를 포함한 모든 3D 고전적 방법을 능가한다.
  • 모델은 HD95가 4.77로, 비교된 모든 방법보다 낮아 경계 정확도가 뛰어나다는 것을 시사한다.
  • BraTS 2020에서 TranSiam는 비교된 모든 방법 중 최고의 딱도 및 민감도 스코어를 기록하여 병변 영역 탐지 능력이 뛰어나다는 것을 입증한다.
  • 추론 실험 결과, ICMT 및 TMM 블록을 통한 컨볼루션과 트랜스포머의 조합이 가장 높은 성능을 낸다는 것이 확인되었으며, 선형 투영 또는 MLP만을 사용한 모델보다 뛰어나다.
  • TranSiam는 단지 7.98만 개의 파rameter만을 사용하여 TransBTS(32.99M)보다 크게 적은 파rameter를 사용함으로써 높은 성능에도 불구하고 효율성을 입증한다.
  • 시각적 분석 결과, TranSiam는 다른 모델이 간과하는 소형 및 대trast가 낮은 종양까지도 성공적으로 분할함을 확인하여 세밀한 세부 정보 유지 능력을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.