[논문 리뷰] Evaluating General Purpose Vision Foundation Models for Medical Image Analysis: An Experimental Study of DINOv2 on Radiology Benchmarks
이 연구는 자기지도 일반 목적 비전 기반 모델인 DINOv2를 방사선학 태스크(분류 및 분할)에서 X-선, CT, MRI를 넘나들며 평가하고, 감독학습, 자기지도학습, 약약지도 baselines와 비교하며 few-shot 및 매개변수 효율적 미세조정(PEFT)을 탐구한다.
The integration of deep learning systems into healthcare has been hindered by the resource-intensive process of data annotation and the inability of these systems to generalize to different data distributions. Foundation models, which are models pre-trained on large datasets, have emerged as a solution to reduce reliance on annotated data and enhance model generalizability and robustness. DINOv2 is an open-source foundation model pre-trained with self-supervised learning on 142 million curated natural images that exhibits promising capabilities across various vision tasks. Nevertheless, a critical question remains unanswered regarding DINOv2's adaptability to radiological imaging, and whether its features are sufficiently general to benefit radiology image analysis. Therefore, this study comprehensively evaluates the performance DINOv2 for radiology, conducting over 200 evaluations across diverse modalities (X-ray, CT, and MRI). To measure the effectiveness and generalizability of DINOv2's feature representations, we analyze the model across medical image analysis tasks including disease classification and organ segmentation on both 2D and 3D images, and under different settings like kNN, few-shot learning, linear-probing, end-to-end fine-tuning, and parameter-efficient fine-tuning. Comparative analyses with established supervised, self-supervised, and weakly-supervised models reveal DINOv2's superior performance and cross-task generalizability. The findings contribute insights to potential avenues for optimizing pre-training strategies for medical imaging and enhancing the broader understanding of DINOv2's role in bridging the gap between natural and radiological image analysis. Our code is available at https://github.com/MohammedSB/DINOv2ForRadiology
연구 동기 및 목표
- 의료 영상에서 주석 데이터 필요성을 줄이고 교차 도메인 일반화를 개선하기 위해 기초 모델의 활용을 촉진한다.
- 2D 및 3D 데이터를 다루는 다양한 방사선학 벤치마크에서 DINOv2를 체계적으로 평가한다(분류 및 분할 태스크 포함).
- 다양한 평가 설정(kNN, 선형 탐지, few-shot, 엔드투엔드 미세조정, PEFT)에서 성능을 평가한다.
- DINOv2를 감독학습, 자기지도학습, 약약지도 기반 기법과 비교해 태스크 간 상대 강점을 파악한다.
제안 방법
- DINOv2 ViT-g/14 및 ViT-L/14(또는 더 작은 증류 버전)을 피처 추출용으로 동결된 백본으로 사용한다.
- X-선, CT, MRI에 걸친 9개의 공개 방사선학 벤치마크에서 분류 및 분할 태스크를 평가한다.
- 가벼운 헤드를 사용한 즉시 사용 가능 성능을 평가하고, 추가로 엔드투엔드 미세조정과 매개변수 효율적 미세조정(LoRA, BitFit)을 시험한다.
- 표준화된 평가 프로토콜(AUROC: 분류, Dice/Jaccard: 분할)에 대해 감독학습, 자기지도학습, 약약지도 모델과 비교한다.
- 분할의 경우 고정 인코더와 선형 대 선 U-네트 디코더를 비교하고, 분류의 경우 kNN, 선형 탐지, few-shot, 미세조정을 분석한다.
- 모델 성능을 고립하고 모델 간 공정한 비교를 가능하게 하기 위해 학습 및 튜닝 파이프라인을 표준화한다.
![Figure 2: PCA component visualization. Following [ 8 ] , the PCA is computed between patches of images that are in the same column, and the first 3 components are shown. This is done for X-ray, CT, and MRI scans. Thresholding is used on the first component to remove the background.](https://ar5iv.labs.arxiv.org/html/2312.02366/assets/images/nih/img_1_pca.png)
실험 결과
연구 질문
- RQ1DINOv2 표현이 방사선학에서 질병 분류와 기관 분할 모두에 일반화될 수 있는가?
- RQ2DINOv2가 방사선학 벤치마크에서 감독학습, 자기지도학습, 약약지도 기반과 비교해 어떤 차이가 있는가?
- RQ3의료 영상 과제에서 DINOv2에 대해 few-shot, 선형 탐지, 엔드투엔드 대 매개변수 효율적 미세조정의 영향은 어떠한가?
- RQ4LoRA, BitFit 같은 PEFT 방법이 방사선학 태스크에 DINOv2를 적용할 때 훨씬 적은 학습 매개변수로 경쟁력 있는 성능을 가능하게 하는가?
- RQ5DINOv2가 2D(X-선)와 3D(CT, MRI) 모달리티 및 다양한 기관/질환 벤치마크에서 어떤 성능을 보이는가?
주요 결과
- DINOv2는 일반적으로 분류 태스크에서 자기지도 및 약약지도 기반보다 우수하거나 경쟁력이 있으며, ImageNet21K 사전학습 모델과의 비교에서 경쟁력을 보인다.
- 분할 태스크에서 DINOv2는 약약지도 방법보다 큰 차이로 우수하며, 많은 태스크에서 엔드투엔드 감독학습 방법에 견주거나 상회한다.
- DINOv2는 교차 태스크 일반화 능력을 보여주며, 특정 설정에서 분할에서 감독학습 모델을 능가하고 분류에서 SAM보다 우수한 경우가 있다.
- 매개변수 효율적 미세조정(LoRA, BitFit)을 사용한 DINOv2 ViT-g/14는 총 매개변수의 1% 미만으로도 경쟁력 있는 결과를 달성하며 엔드투엔드 미세조정 성능에 근접한다.
- SAM과 비교할 때 방사선 데이터셋에서 DINOv2가 분류 성능이 우수하며, 태스크 및 모달리티 전반에 걸친 교차 태스크 일반화가 강조된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.