Skip to main content
QUICK REVIEW

[논문 리뷰] Are Natural Domain Foundation Models Useful for Medical Image Classification?

Joana Palés Huix, Ganeshan, Adithya Raju|arXiv (Cornell University)|2023. 10. 30.
COVID-19 diagnosis using AI인용 수 4
한 줄 요약

이 연구는 네 가지 벤치마크 데이터셋에서 의료 영상 분류를 위해 다섯 가지 최신 기초 모델—DINOv2, CLIP, BLIP, SAM, SEE-MS—을 평가한다. DINOv2는 ImageNet-1k 지도 학습 전훈을 일관되게 능가하지만, 다른 모델들은 이 기준을 넘어서지 못해 자연 도메인에서 강력한 성능을 보이는 바에도 불구하고 모든 기초 모델이 의료 영상에 일반화되지는 않음을 시사한다.

ABSTRACT

The deep learning field is converging towards the use of general foundation models that can be easily adapted for diverse tasks. While this paradigm shift has become common practice within the field of natural language processing, progress has been slower in computer vision. In this paper we attempt to address this issue by investigating the transferability of various state-of-the-art foundation models to medical image classification tasks. Specifically, we evaluate the performance of five foundation models, namely SAM, SEEM, DINOv2, BLIP, and OpenCLIP across four well-established medical imaging datasets. We explore different training settings to fully harness the potential of these models. Our study shows mixed results. DINOv2 consistently outperforms the standard practice of ImageNet pretraining. However, other foundation models failed to consistently beat this established baseline indicating limitations in their transferability to medical image classification tasks.

연구 동기 및 목표

  • 자연 도메인 기초 모델의 전이 가능성(transferability)을 의료 영상 분류 작업에 대해 평가하는 것.
  • 자기지도 학습 및 대조 학습 전훈 모델(예: DINOv2, CLIP, BLIP)의 성능을 표준 ImageNet-1k 지도 기반 전훈과 비교하는 것.
  • 의료 데이터셋에서 백본(fine-tuning 또는 고정) 전략이 성능에 미치는 영향을 분석하는 것.
  • 의료 미세조정 과정에서 기초 모델의 각 레이어에서의 특징 재사용 및 적응을 분석하는 것.
  • 모델 아키텍처 설계 또는 전훈 목표가 의료 영상에서의 전이 성공에 미치는 영향을 규명하는 것.

제안 방법

  • 네 가지 의료 영상 데이터셋(ISIC, ChestX-ray14, NIH, Chexpert)에서 다섯 가지 기초 모델(DINOv2, CLIP (OpenCLIP), BLIP, SAM, SEE-MS)을 평가.
  • 다양한 적응 전략을 평가하기 위해 선형 헤드와 ViT 기반 분류자 헤드를 모두 사용.
  • 전체 미세조정 및 부분 미세조정(특정 레이어를 고정하거나 해제)을 수행하여 특징 적응을 분석.
  • 태스크 특화 적응 없이도 특징 품질과 전이 가능성을 평가하기 위해 k-NN 평가를 적용.
  • 활성화 맵을 사용하여 모델 간 및 데이터셋 간 표현을 비교하기 위해 특징 유사도 분석을 수행.
  • 데이터 크기와 해상도의 민감도를 평가하기 위해 고해상도 입력을 사용하고 다양한 데이터셋 크기를 적용하여 모델을 훈련.

실험 결과

연구 질문

  • RQ1자연 영상 데이터에서 전훈된 기초 모델이 의료 영상 분류에서 표준 ImageNet-1k 지도 전훈을 능가할 수 있는가?
  • RQ2백본을 미세조정하는 것과 고정하는 것 중 어느 것이 다양한 기초 모델에서 성능에 더 큰 영향을 미치는가?
  • RQ3기초 모델의 초기 레이어와 후기 레이어 중 어느 것이 의료 작업에 대해 더 전이 가능한 특징를 갖는가?
  • RQ4자연 시각에서 강력한 제로샷 성능를 보이는 일부 기초 모델(예: SAM, BLIP)이 왜 의료 영상에서 성능이 열등한가?
  • RQ5전훈 목표(자기지도 학습 대비 텍스트를 동반한 대조 학습)가 의료 영상으로의 전이 가능성에 어떤 영향을 미치는가?

주요 결과

  • DINOv2는 네 가지 의료 데이터셋 전반에서 ImageNet-1k 지도 전훈을 일관되게 능가하여 뛰어난 전이 가능성(transferability)을 입증했다.
  • SAM, BLIP 및 OpenCLIP는 대부분의 설정에서 ImageNet-1k 기준을 넘어서지 못해 의료 영상으로의 일반화 능력이 제한됨을 시사했다.
  • 기초 모델을 고정하면 성능 저하가 발생했으며, 특히 후행 레이어에서 두드러져 고수준 특징가 의료 작업에 직접 전이되지 않음을 시사했다.
  • DINOv2의 미세조정은 다른 모델보다 수렴 속도가 빠르고 성능이 높았는데, 이는 적응이 필요한 레이어 수가 적기 때문일 것이다.
  • 특징 유사도 분석 결과, 초기 레이어는 모델 간 특징 재사용이 높았고, 후행 레이어는 미세조정 과정에서 크게 적응함을 확인해, 작업 특화 적응이 필수적임을 입증했다.
  • DeiT 분류자 헤드를 추가해도 성능 향상이 미미하여, 기초 모델에서 유도된 고수준 특징가 후속 의료 분류자에 최적의 입력이 되지 못함을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.