[논문 리뷰] BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs
BiomedCLIP 프리트레인은 PubMed Central의 15 million 이미지-설명 데이터세트에서 도메인 특화 비전-언어 기초 모델을 사전 학습하여 생물의학 도메인에서 검색, 분류, 및 VQA에서 최첨단 성능을 달성합니다.
Biomedical data is inherently multimodal, comprising physical measurements and natural language narratives. A generalist biomedical AI model needs to simultaneously process different modalities of data, including text and images. Therefore, training an effective generalist biomedical model requires high-quality multimodal data, such as parallel image-text pairs. Here, we present PMC-15M, a novel dataset that is two orders of magnitude larger than existing biomedical multimodal datasets such as MIMIC-CXR, and spans a diverse range of biomedical image types. PMC-15M contains 15 million biomedical image-text pairs collected from 4.4 million scientific articles. Based on PMC-15M, we have pretrained BiomedCLIP, a multimodal foundation model, with domain-specific adaptations tailored to biomedical vision-language processing. We conducted extensive experiments and ablation studies on standard biomedical imaging tasks from retrieval to classification to visual question-answering (VQA). BiomedCLIP achieved new state-of-the-art results in a wide range of standard datasets, substantially outperforming prior approaches. Intriguingly, by large-scale pretraining on diverse biomedical image types, BiomedCLIP even outperforms state-of-the-art radiology-specific models such as BioViL in radiology-specific tasks such as RSNA pneumonia detection. In summary, BiomedCLIP is a fully open-access foundation model that achieves state-of-the-art performance on various biomedical tasks, paving the way for transformative multimodal biomedical discovery and applications. We release our models at https://aka.ms/biomedclip to facilitate future research in multimodal biomedical AI.
연구 동기 및 목표
- 크고 다양한 개방형 생물의학 비전-언어 데이터세트의 필요성을 해결한다.
- 길이가 긴 생물의학 캡션과 고해상도 이미지를 활용하는 도메인 특화 다중모달 모델을 사전 학습한다.
- 검색, 제로샷 분류 및 의료 VQA에 걸쳐 BiomedCLIP을 평가하여 최첨단 성능을 확립한다.
- 대규모의 다양하고 생물의학 분야의 사전 학습이 특정 작업에서 방사선학 중심 모델보다 우수할 수 있음을 보여준다.
제안 방법
- PubMed Central 기사에서 1500만 개의 그림-설명 쌍으로 구성된 공개 데이터세트 PMC-15M를 만든다.
- CLIP를 생물의학에 맞춘 텍스트 인코더(PubMedBERT)와 더 큰 해상도의 비전 인코더를 적용한 CLIP로 적응시킨다.
- 생물의학 사전 학습 효율성과 성능을 최적화하기 위해 패치 드롭아웃과 맞춤형 배치 크기를 구현한다.
- 세분화된 이미지-텍스트 쌍을 위한 split 패널 및 인라인 시턴스를 포함하여 PMC-Fine-Grained-46M을 구축해 데이터 다양성을 강화한다.
- 검색, 분류 및 VQA에 걸친 8개의 표준 생물의학 비전-언어 작업을 사용해 평가하고 일반 도메인 CLIP, PubMedCLIP, MedCLIP, BioViL과 비교한다.
실험 결과
연구 질문
- RQ1크고 다양한 개방형 생물의학 이미지-텍스트 데이터세트로의 학습이 생물의학에서 비전-언어 일반화 성능을 향상시키는가?
- RQ2BiomedCLIP은 검색, 분류 및 VQA 작업에서 일반 도메인 및 방사선학 중심 모델과 비교했을 때 어떤 차이가 있는가?
- RQ3도메인 특화 조정(텍스트 및 이미지 인코더, 토큰화, 이미지 해상도)이 생물의학 다중모달 성능을 극대화하는가?
- RQ4다양한 사전 학습 데이터가 생물의학 분류 내의 교차 도메인 전이(예: 방사선학 대 병리학)에 가능하게 하는가?
주요 결과
- BiomedCLIP은 높은 교차 모달 검색 정확도를 달성하며, top-1 및 top-5 재현율이 일반 도메인 CLIP 및 PubMedCLIP보다 크게 우수하다.
- BiomedCLIP은 다섯 데이터셋에 걸친 제로샷 이미지 분류에서 우수한 성능을 보이고 RSNA 벤치마크에서 방사선학 중심 모델 BioViL보다 더 적은 라벨 데이터로도 우수하다.
- BiomedCLIP은 의료 VQA 벤치마크(VQ-RAD, SLAKE)에서 최첨단 성능을 달성하고 개방형 질문에서도 강한 성능을 보인다.
- PMC-15M의 다양한 이미지 유형에 대한 사전 학습은 방사선학 단일 주제의 사전 학습을 여러 작업에서 능가하는 강인한 표현을 만든다.
- 본 연구는 대규모의 도메인 특화 다중모달 사전 학습이 개방형 고성능 생물의학 AI 모델을 가능하게 할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.