Skip to main content
QUICK REVIEW

[논문 리뷰] TransFusion: Multi-view Divergent Fusion for Medical Image Segmentation with Transformers

Di Liu, Yunhe Gao|arXiv (Cornell University)|2022. 03. 21.
Medical Image Segmentation Techniques인용 수 4
한 줄 요약

TransFusion는 비정렬된 심장 MRI 스캔에서 장거리 크로스뷰 및 크로스스케일 의존성을 모델링하기 위해 Divergent Fusion Attention (DiFA)와 Multi-Scale Attention (MSA)를 사용하는 새로운 트랜스포머 기반 아키텍처를 제안한다. 이는 M&Ms-2 챌린지에서 최신 기술 성능을 달성하여, 단축축 및 장축 심실 분할에서 각각 89.78%의 Dice 스코어와 8.02mm의 HD를 기록한다.

ABSTRACT

Combining information from multi-view images is crucial to improve the performance and robustness of automated methods for disease diagnosis. However, due to the non-alignment characteristics of multi-view images, building correlation and data fusion across views largely remain an open problem. In this study, we present TransFusion, a Transformer-based architecture to merge divergent multi-view imaging information using convolutional layers and powerful attention mechanisms. In particular, the Divergent Fusion Attention (DiFA) module is proposed for rich cross-view context modeling and semantic dependency mining, addressing the critical issue of capturing long-range correlations between unaligned data from different image views. We further propose the Multi-Scale Attention (MSA) to collect global correspondence of multi-scale feature representations. We evaluate TransFusion on the Multi-Disease, Multi-View \& Multi-Center Right Ventricular Segmentation in Cardiac MRI (M\&Ms-2) challenge cohort. TransFusion demonstrates leading performance against the state-of-the-art methods and opens up new perspectives for multi-view imaging integration towards robust medical image segmentation.

연구 동기 및 목표

  • 비정렬된 다중 시야 의료 영상—특히 단축축 및 장축 심장 MRI—를 융합하여 분할 성능을 향상시키는 데 도전한다.
  • 기존의 컨volutional 융합 방식이 실패하는 이질적인 영상 데이터에서 장거리 크로스뷰 및 크로스스케일 의존성을 모델링한다.
  • 다양한 시야와 스케일 간에 강력하고 주목사용 기반의 특징 정렬을 가능하게 하는 통합 프레임워크를 개발한다.
  • 다중 센터 및 다중 질환 심장 MRI 분할 작업에서 트랜스포머 기반 융합의 효과성을 입증한다.

제안 방법

  • 비정렬된 영상 특징 간의 크로스뷰 컨텍스트 및 의미적 의존성을 명시적으로 모델링하기 위해 Divergent Fusion Attention (DiFA) 모듈을 도입한다.
  • 피라미드형 네트워크 아키텍처에서 다중 스케일 특징 표현 간의 전역적 대응을 수집하기 위해 Multi-Scale Attention (MSA)를 활용한다.
  • 단축축 및 장축 cMRI 입력을 별도로 처리하기 위해 하이브리드 3D + 2D 백본(3D 및 2D UTNet)을 사용한다.
  • DiFA 및 MSA 블록을 인코더의 여러 수준에 적용하여 크로스뷰 및 크로스스케일 특징 표현을 점진적으로 개선한다.
  • 공간 정렬 및 시야 간의 컨텍스트 모델링을 향상시키기 위해 하이브리드 2.5D + 3D + 2D 네트워크 모드를 활용한다.
  • DiFA 및 MSA 모듈에서 융합된 특징을 다양한 스케일에서 통합하는 스킵 연결을 포함한 U-Net 스타일 디코더를 사용한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처는 비정렬된 다중 시야 의료 영상 간의 장거리 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2표준 주목사용 또는 연결 방식과 비교해 Divergent Fusion Attention (DiFA) 모듈은 크로스뷰 특징 정렬 및 의미 일致성에 어떻게 기여하는가?
  • RQ3네트워크 깊이에 따라 DiFA 모듈의 최적의 배치 및 수는 무엇이며, 이를 통해 분할 성능을 최대화할 수 있는가?
  • RQ4제안된 다중 시야 융합 전략은 단일 시야 또는 단순 연결 기반 융합과 비교해 정확성 및 내성에 있어 어떻게 우월한가?
  • RQ5하이브리드 3D + 2D 네트워크 모드는 다중 시야 심장 MRI에서 특징 정렬 및 분할 성능 향상에 얼마나 기여하는가?

주요 결과

  • TransFusion는 우측 심실 분할 작업에서 89.78%의 Dice 스코어를 기록하여, 이전 최고 성능 모델(rDLA*)의 86.49%를 크게 초월한다.
  • 모델은 평균 하우스도르프 거리(HD)가 8.02mm로, 비교된 모든 방법 중에서 가장 낮아 경계 정확도가 뛰어나다는 것을 나타낸다.
  • 제거 실험 결과, DiFA 모듈을 높은 인코더 수준(예: 수준 4 및 5)에 배치할 경우 성능 향상이 가장 일관되게 나타나며, 수준 4를 초과하면 수익 감소가 발생함을 확인했다.
  • 하이브리드 3D + 2D 네트워크 모드는 2.5D 및 단일 시야 기반 베이스라인보다 성능이 뛰어나, 시야 간 공간 정렬의 중요성을 입증한다.
  • UTNet 및 MCTrans와 같은 기존 모델에 DiFA 모듈을 적용했을 때도 일관되게 성능 향상이 관찰되어, 그 일반화 가능성과 효과성을 입증한다.
  • 제안된 방법은 비정렬 또는 다중 모odal 데이터 융합을 위한 트랜스포머 기반 접근을 처음으로 적용한 것으로, 새로운 연구 방향을 열었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.