Skip to main content
QUICK REVIEW

[논문 리뷰] Transformers in Medical Imaging: A Survey

Fahad Shamshad, Salman Khan|arXiv (Cornell University)|2022. 01. 24.
Advanced Neural Network Applications인용 수 15
한 줄 요약

이 종합 검토는 의료 영상 분야에서 비전 트랜스포머(Vision Transformer, ViT)의 적용에 대해 종합적으로 다루며, 분할, 분류, 탐지, 재구성, 임상 보고서 생성 등 다양한 분야를 포함한다. 아키텍처 설계를 분석하고 응용 분야에 특화된 과제를 규명하며 추세를 강조함으로써, 지역적 인덕티브 바이어스를 가진 CNN 대비 글로벌 컨텍스트 모델링에 초점을 맞춘 빠르게 변화하는 분야에서 연구자들이 나아가야 할 길잡이를 제시한다.

ABSTRACT

Following unprecedented success on the natural language tasks, Transformers have been successfully applied to several computer vision problems, achieving state-of-the-art results and prompting researchers to reconsider the supremacy of convolutional neural networks (CNNs) as {de facto} operators. Capitalizing on these advances in computer vision, the medical imaging field has also witnessed growing interest for Transformers that can capture global context compared to CNNs with local receptive fields. Inspired from this transition, in this survey, we attempt to provide a comprehensive review of the applications of Transformers in medical imaging covering various aspects, ranging from recently proposed architectural designs to unsolved issues. Specifically, we survey the use of Transformers in medical image segmentation, detection, classification, reconstruction, synthesis, registration, clinical report generation, and other tasks. In particular, for each of these applications, we develop taxonomy, identify application-specific challenges as well as provide insights to solve them, and highlight recent trends. Further, we provide a critical discussion of the field's current state as a whole, including the identification of key challenges, open problems, and outlining promising future directions. We hope this survey will ignite further interest in the community and provide researchers with an up-to-date reference regarding applications of Transformer models in medical imaging. Finally, to cope with the rapid development in this field, we intend to regularly update the relevant latest papers and their open-source implementations at \url{https://github.com/fahadshamshad/awesome-transformers-in-medical-imaging}.

연구 동기 및 목표

  • 다양한 의료 영상 작업 전반에서 비전 트랜스포머(Vision Transformer, ViT) 응용에 대한 통합적이고 최신의 검토를 제공하기 위해.
  • 최근 ViT 기반 방법의 발전을 통합함으로써 컴퓨터 비전과 의료 영상 분야 간 격차를 메우기 위해.
  • 분할, 분류, 보고서 생성과 같은 의료 영상 작업에서의 응용 분야 특화 과제를 규명하기 위해.
  • 의료 영상 분야에서 ViT 도입에 있어 핵심 추세, 아키텍처 혁신, 열린 문제를 부각하기 위해.
  • 임상 및 진단 영상 분야에서 트랜스포머 기반 솔루션을 탐색하는 연구자들에게 길잡이이자 참고 자료로 기능하기 위해.

제안 방법

  • 응용 분야 기반으로 125篇 이상의 관련 논문을 체계적으로 분류: 분할, 분류, 탐지, 재구성, 합성, 정렬, 임상 보고서 생성, 기타.
  • 각 응용 분야에 대해 분류 체계를 수립하고, ViT 기반 모델의 아키텍처 설계 및 방법론적 혁신을 분석한다.
  • 의료 영상에서 장거리 상관관계와 글로벌 컨텍스트를 포착하는 능력을 평가함으로써 ViT와 전통적인 CNN 간의 비교를 수행한다.
  • 임bedding 공간의 마할라노비스 거리와 주성분 분석(PCA) 투영을 사용하여 분포 외(OOD) 탐지 성능을 분석한다.
  • MRI, CT, X-ray, 초음파, 현미경 영상 등 다양한 모odalities와 작업에 대해 벤치마크 연구의 실증 결과를 활용해 ViT의 성능을 평가한다.
  • 도메인 이동, 불확실성 추정, 표준화된 평가 프로토콜 부족 등 현재 ViT 기반 의료 시스템에서의 열린 과제를 부각시킨다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머가 의료 영상에서 장거리 상관관계를 어떻게 CNN보다 더 잘 포착하는가?
  • RQ2특정 의료 영상 작업을 위한 ViT 기반 모델에서의 핵심 아키텍처 및 방법론적 혁신은 무엇인가?
  • RQ3임상 응용 분야에 ViT를 구현할 때 주로 발생하는 과제, 특히 내성성과 불확실성 추정 측면에서의 과제는 무엇인가?
  • RQ4ViT는 OOD 탐지에서 CNN보다 어떻게 성능을 발휘하는가? 인간 예측과의 일관성 향상에 대한 증거는 무엇인가?
  • RQ5생명 위험 요소가 포함된 진단 시스템에서 ViT 도입을 진전시키기 위해 가장 유망한 향후 연구 방향은 무엇인가?

주요 결과

  • 비전 트랜스포머는 주요 의료 영상 작업 전반에 걸쳐 급속히 확산되었으며, 2021년 기준 분할 작업의 85%, 분류 작업의 89%가 ViT 기반 논문이었고, 이는 2012–2015년 동안 CNN 기반 논문의 비율인 73%와 85%와 대비된다.
  • ImageNet-21k에서 사전 학습하고, 내부 분포 데이터에서 미세조정한 ViT는 임베딩의 더 나은 클러스터링과 OOD 입력에 대한 높은 마할라노비스 이상치 점수를 보이며, 더 나은 불확실성 추정 능력을 나타낸다.
  • ViT는 인간 앙케이트와의 예측 오차 일관성이 CNN보다 더 높아, 임상 의사결정과의 보다 잘 맞는 경향을 보인다.
  • 강력한 성능에도 불구하고, 복잡한 의료 영상 무늬와 척도 변화에서 OOD 탐지에 있어 도전 과제를 겪고 있으며, 특히 제한된 또는 도메인 이동된 데이터로 학습된 경우 더욱 그렇다.
  • 현재 ViT 기반 의료 시스템은 도메인 적응을 위한 표준화된 평가 프로토콜가 부족하여, 의료 영상 분야에서 DOMAINBED와 같은 프레임워크의 필요성이 제기된다.
  • 지속적 학습 및 도메인 적응 기법은 ViT 기반 의료 영상 분야에서 아직 탐색되지 않은 분야로, 내성적인 구현을 위한 유망한 향후 연구 방향이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.