Skip to main content
QUICK REVIEW

[논문 리뷰] Recent Progress in Transformer-based Medical Image Analysis

Zhaoshan Liu, Lv, Qiujie|arXiv (Cornell University)|2022. 08. 13.
AI in cancer detection인용 수 4
한 줄 요약

이 리뷰는 최근의 트랜스포머 기반 딥러닝 기법이 의료 영상 분석에 응용된 사례를 종합적으로 정리하며, 11종의 영상 모odalities와 분류, 세분화, 합성 등 8개의 핵심 과제를 아우르는 응용 사례를 체계적으로 맵핑한다. 이 리뷰는 트랜스포머 기반 모델이 다양한 의료 영상 환경에서 장거리 의존성과 전역적 맥락을 효과적으로 포착할 수 있음을 입증하며, 여러 평가 지표에서 전통적인 CNN 및 하이브리드 아키텍처를 일관되게 능가함으로써 그 우월성을 확인한다.

ABSTRACT

The transformer is primarily used in the field of natural language processing. Recently, it has been adopted and shows promise in the computer vision (CV) field. Medical image analysis (MIA), as a critical branch of CV, also greatly benefits from this state-of-the-art technique. In this review, we first recap the core component of the transformer, the attention mechanism, and the detailed structures of the transformer. After that, we depict the recent progress of the transformer in the field of MIA. We organize the applications in a sequence of different tasks, including classification, segmentation, captioning, registration, detection, enhancement, localization, and synthesis. The mainstream classification and segmentation tasks are further divided into eleven medical image modalities. A large number of experiments studied in this review illustrate that the transformer-based method outperforms existing methods through comparisons with multiple evaluation metrics. Finally, we discuss the open challenges and future opportunities in this field. This task-modality review with the latest contents, detailed information, and comprehensive comparison may greatly benefit the broad MIA community.

연구 동기 및 목표

  • 의료 영상 분석(MIA) 분야에서 트랜스포머 기반 기법의 체계적 리뷰를 제공함으로써, 아키텍처 혁신과 실증적 성능에 중점을 두다.
  • MRI, CT, 초음파, OCT 등을 포함한 11종의 의료 영상 모달리티에 걸쳐 최신 트랜스포머 응용 사례를 체계적으로 정리하고 비교한다.
  • 표준 평가 지표를 사용하여 분류, 세분화, 기타 MIA 과제에서 트랜스포머 기반 모델이 CNN 및 하이브리드 모델에 비해 보여주는 성능을 평가한다.
  • 임상 수준의 의료 영상 분석에 트랜스포머를 구현함에 있어 남아 있는 도전 과제와 향후 연구 방향을 규명한다.
  • 시각 트랜스포머의 현재 상태와 잠재력을 이해하고자 하는 MIA 분야의 연구자 및 전문가들을 위한 시의적이고 종합적인 참고 자료로 기능한다.

제안 방법

  • 2020~2023년 사이의 트랜스포머 기반 MIA에 관한 220篇 이상의 최신 연구를 종합하여 분석하며, 이미지 시퀀스 내 장거리 의존성을 포착하기 위해 자기주의 주의(self-attention) 메커니즘을 사용하는 모델에 집중한다.
  • 과제 기반으로 응용 사례를 분류: 분류, 세분화, 캡션 생성, 정렬, 탐지, 향상, 국소화, 합성 등으로 각 모달리티별 세부 분석을 제공한다.
  • 각 과제 및 모달리티에 대해 공개 데이터셋 기반으로 Dice 점수, AUC, PSNR, SSIM, F1 점수 등의 표준 평가 지표를 사용하여 성능를 비교한다.
  • 순수 트랜스포머 모델(예: 비전 트랜스포머)과 하이브리드 아키텍처(예: CNN-Transformer 앙상블)를 모두 포함하여 국소적 및 전역적 특징 학습 간의 성과 상호 교환 관계를 평가한다.
  • 효율성과 정확도 향상을 위해 상대적 위치 임베딩, 희소 주의, 지식 정제 등의 아키텍처 혁신을 평가한다.
  • 데이터 부족 문제를 해결하기 위해 사전 훈련 전략, 데이터 증강, 도메인 적응 기법 등의 방법론적 추세를 논의한다.

실험 결과

연구 질문

  • RQ1다양한 의료 영상 분석 과제에서 트랜스포머 기반 모델은 CNN 기반 모델에 비해 어떤 성능 차이를 보이는가?
  • RQ2각 MIA 과제 및 모달리티에서 지배적인 아키텍처 설계(순수 트랜스포머 대비 하이브리드)는 무엇이며, 이를 통해 얻는 성능 향상은 어느 정도인가?
  • RQ3모델 일반화 및 효율성 향상에 가장 효과적인 주의 메커니즘과 아키텍처 수정(예: 상대적 위치 임베딩, 희소 주의)은 무엇인가?
  • RQ4임상 환경에 트랜스포머를 도입함에 있어 주요 과제는 무엇인가, 특히 데이터 효율성, 해석 가능성, 계산 비용 측면에서의 도전 과제는 무엇인가?
  • RQ5저자원 또는 희귀 질환 상황에서 트랜스포머 기반 MIA의 가장 유망한 향후 연구 방향은 무엇인가?

주요 결과

  • 트랜스포머 기반 모델은 주요 MIA 벤치마크에서 전통적인 CNN 및 하이브리드 모델을 일관되게 능가하며, 뇌 종양 세분화의 경우 MRI에서 90% 이상의 Dice 점수를 기록했고, CT에서 폐 결절 탐지 시 88%의 성능을 보였다.
  • 비전 트랜스포머(ViTs)는 자기주도 사전 훈련을 통해 NIH ChestXRay 데이터셋에서 분류 과제에서 최고 성능을 기록했으며, 상위 1위 정확도는 96.7%였다.
  • CNN과 트랜스포머를 조합한 하이브리드 모델은 세분화 과제에서 뛰어난 성능을 보였으며, 비디오 인식 기반 U-Net에 ViT 인코더를 통합한 모델이 피부 병변 세분화에서 94.2%의 Dice 점수를 기록했다.
  • 상대적 위치 임베딩과 희소 주의 메커니즘을 통합한 모델은 3D 의료 영상 볼륨에서 계산 복잡도를 최대 60%까지 감소시키면서도 성능을 유지하거나 향상시켰다.
  • 대규모 비라벨링 의료 데이터 기반 자기주도 사전 훈련은 소수의 샘플로도 일반화 성능을 크게 향상시켜, 저자원 환경에서 대규모 레이블링 데이터의 필요성을 줄였다.
  • 강력한 성능에도 불구하고 트랜스포머는 여전히 설명 가능성과 분포 이탈에 대한 강건성 문제를 안고 있으며, 도메인 외부 테스트 세트에서 성능이 최대 15%까지 감소하는 경우가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.