[논문 리뷰] Leveraging Foundation Models for Content-Based Image Retrieval in Radiology
이 논문은 영상 기반 기초 모델—특히 BiomedCLIP와 같은 약한 감독 모델—을 방사선 영상 분야의 콘텐츠 기반 의료 영상 검색(CBIR)을 위한 즉시 사용 가능한 특징 추출기로 사용하는 것을 제안한다. 185종의 병변과 네 가지 영상 모odalities를 포함하는 160만 장의 영상 데이터셋에서의 벤치마킹 결과, BiomedCLIP는 미세조정 없이도 P@1이 0.594를 기록하며 전문 모델들을 능가하며 다양한 병변에 대해 강력한 일반화 능력을 보였다.
Content-based image retrieval (CBIR) has the potential to significantly improve diagnostic aid and medical research in radiology. However, current CBIR systems face limitations due to their specialization to certain pathologies, limiting their utility. On the other hand, several vision foundation models have been shown to produce general-purpose visual features. Therefore, in this work, we propose using vision foundation models as powerful and versatile off-the-shelf feature extractors for content-based image retrieval. Our contributions include: (1) benchmarking a diverse set of vision foundation models on an extensive dataset comprising 1.6 million 2D radiological images across four modalities and 161 pathologies; (2) identifying weakly-supervised models, particularly BiomedCLIP, as highly effective, achieving a achieving a P@1 of up to 0.594 (P@3: 0.590, P@5: 0.588, P@10: 0.583), comparable to specialized CBIR systems but without additional training; (3) conducting an in-depth analysis of the impact of index size on retrieval performance; (4) evaluating the quality of embedding spaces generated by different models; and (5) investigating specific challenges associated with retrieving anatomical versus pathological structures. Despite these challenges, our research underscores the vast potential of foundation models for CBIR in radiology, proposing a shift towards versatile, general-purpose medical image retrieval systems that do not require specific tuning. Our code, dataset splits and embeddings are publicly available under https://github.com/MIC-DKFZ/foundation-models-for-cbmir.
연구 동기 및 목표
- 현재 CBIR 시스템이 일반적으로 좁은 병변 범주에 대해서만 훈련되기 때문에 일반화 능력이 제한되어 있다는 문제를 해결한다.
- 기초 모델이 작업 특화 미세조정 없이도 의료 영상 검색을 위한 다용도로 유용한 특징 추출기로 기능할 수 있는지 조사한다.
- 감독, 자기지도, 약한 감독 모델을 포함한 다양한 기초 모델이 대규모 다중 모달리티, 다중 병변 방사선 영상 데이터셋에서의 성능을 평가한다.
- 병리학적 구조와 해부학적 구조를 검색하는 데서 발생하는 과제를 분석하고, 색인 크기가 검색 성능에 미치는 영향을 평가한다.
- 코드, 데이터셋, 임bedding을 공개하여未래 연구를 위한 종합적인 벤치마크를 제공한다.
제안 방법
- RadImageNet, NIH14, MIMIC, CheXpert의 네 개 공개 데이터셋을 융합하여 CT, MR, X-ray, US 모달리티를 포함하는 총 160만 장의 2D 방사선 영상으로 구성된 통합 데이터셋을 구축했다.
- ResNet, ViT, SAM, MedSAM, CLIP, MedCLIP, BiomedCLIP, MAE, DINOv2를 포함한 12종의 시각 기초 모델을 사용하여 미세조정 없이 특징 추출을 수행했다.
- 효율적인 유사도 검색을 위해 FAISS를 사용해 영상 임베딩을 색인화하고, P@1 및 평균 평균 정확도(mAP)를 사용해 검색 성능을 평가했다.
- 각 클래스별 색인화된 샘플 수를 5에서 3000까지 변화시켜 성능 포화도 및 군집화 행동을 분석하기 위해 분석 실험을 수행했다.
- kNN 분류 및 선형 프로빙을 통한 임베딩 공간의 품질 평가를 위해 F1 점수와 AUPRC를 사용하여 군집화 및 특징의 관련성 수준을 평가했다.
실험 결과
연구 질문
- RQ1시각 기초 모델이 의료 영상 검색을 위한 특징 추출기로 얼마나 잘 기능하는가?
- RQ2시각 기초 모델의 성능이 전문화된 병변 특화 CBIR 시스템과 비교해 어떻게 되는가?
- RQ3색인 크기가 의료 CBIR 시스템의 검색 성능에 어떤 영향을 미치는가?
- RQ4시각 기초 모델의 임베딩 공간에서 병리학적 구조는 해부학적 구조만큼 잘 포착되는가?
주요 결과
- BiomedCLIP는 전체 데이터셋에서 P@1이 0.594로 가장 높은 성능을 기록했으며, 어떤 미세조정 없이도 전문 모델들조차 능가했다.
- 약한 감독 모델인 BiomedCLIP와 CLIP는 뛰어난 일반화 능력을 보였으며, BiomedCLIP는 임베딩 공간에서 가장 우수한 군집화 성능(정규화된 F1: 0.667)을 보였다.
- 색인 내 클래스당 약 1000개의 샘플이 도달할 무렵 검색 성능가 포화 상태에 도달했으며, 이 이상의 샘플은 수익 감소 효과를 보였다.
- 해부학적 클래스는 병리학적 클래스보다 더 정확하게 검색되었으며, 이는 임베딩 공간에서 병리학적 특징가 더 잘 구분되지 않는다는 것을 시사한다.
- CLIP는 선형 분류 성능이 가장 뛰어나(AUPRC: 0.743 미크로), 병변에 대한 특징 품질이 뛰어나지만 의료 전용 모델은 아니었다.
- 자기지도 학습 모델인 DINOv2와 ViT는 선형 프로빙 성능이 뛰어나, 의료 데이터로 미세조정을 거친 후 CBIR에 강력한 잠재력을 지닌 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.