[논문 리뷰] BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks
BiomedGPT는 다양한 생의학적 작업을 위한 오픈 소스 일반 목적의 비전-언어 모델로, 26개 데이터셋의 25개 실험 중 15개에서 SOTA를 달성하고 182M 매개변수로 제로샷 전이를 가능하게 한다.
Traditional biomedical artificial intelligence (AI) models, designed for specific tasks or modalities, often exhibit limited flexibility in real-world deployment and struggle to utilize holistic information. Generalist AI holds the potential to address these limitations due to its versatility in interpreting different data types and generating tailored outputs for diverse needs. However, existing biomedical generalist AI solutions are typically heavyweight and closed source to researchers, practitioners, and patients. Here, we propose BiomedGPT, the first open-source and lightweight vision-language foundation model, designed as a generalist capable of performing various biomedical tasks. BiomedGPT achieved state-of-the-art results in 16 out of 25 experiments while maintaining a computing-friendly model scale. We also conducted human evaluations to assess the capabilities of BiomedGPT in radiology visual question answering, report generation, and summarization. BiomedGPT exhibits robust prediction ability with a low error rate of 3.8% in question answering, satisfactory performance with an error rate of 8.3% in writing complex radiology reports, and competitive summarization ability with a nearly equivalent preference score to human experts. Our method demonstrates that effective training with diverse data can lead to more practical biomedical AI for improving diagnosis and workflow efficiency.
연구 동기 및 목표
- 영상과 텍스트에 걸친 다양한 생의학적 작업을 포괄하는 통합된 일반 목적 AI 모델의 필요성을 제시한다.
- 다양한 멀티모달 생의학 데이터에 대해 단일 모델을 사전 학습시켜 보편적 표현을 학습한다.
- 시각 전문, 언어, 멀티모달 작업을 처리하기 위해 태스크별 지시사항으로 미세조정한다.
- 대형 비공개 모델과의 성능을 평가하고 실제 적용 가능성을 입증한다.
- 모델 체크포인트, 학습 데이터 처리 및 코드를 오픈 소싱하여 투명성을 촉진한다.
제안 방법
- BERT형 인코더와 GPT형 디코더를 갖춘 시퀀스-투-시퀀스 BiomedGPT를 사용한다.
- 영상, 텍스트, 멀티모달 데이터를 포함하는 14개의 자유롭게 이용 가능한 생의학 데이터셋에서 사전 학습한다(352,567 이미지; ~183M 텍스트 문장; 46,408 객체-레이블 쌍; ~271,803 이미지-텍스트 쌍).
- 다섯 가지 사전 학습 작업을 활용한다: 이미지 전용 마스킹 이미지 모델링, 텍스트 전용 마스킹 언어 모델링, 이미지 자막 생성, 시각적 질문 응답(VQA).
- 다섯 가지 의료 AI 작업(분류, 언어 이해, 요약, 자막 생성, VQA)에 걸친 25개 다운스트림 데이터셋에 대해 지시 기반 프롬프트로 미세조정한다.
- 세 가지 모델 규모(BiomedGPT-S, -M, -B)를 탐색하여 규모 효과를 연구한다; 일반 및 의료 지식을 주입하기 위해 OFA에서 초기화한다.

실험 결과
연구 질문
- RQ1하나의 단일 통합 모델이 시각과 언어 전반에 걸친 여러 생의학적 모달리티와 작업을 효과적으로 처리할 수 있는가?
- RQ2다양하고 다중 작업의 사전 학습이 생의학에서 일반화와 다운스트림 성능을 향상시키는가?
- RQ3모델 크기가 시각, 언어 이해 및 멀티모달 생의학 작업의 성능에 어떤 영향을 미치는가?
- RQ4단일 생의학 모델의 제로샷 VQA 능력이 대형 멀티모달 시스템에 비해 어떤가요?
- RQ5BiomedGPT의 실제 배포 및 방사선 전문의 평가에서의 성능은 어떤가?
주요 결과
- BiomedGPT는 26개 데이터셋의 25개 실험 중 15개에서 SOTA를 달성한다.
- 182M 매개변수 BiomedGPT-B 모델은 VQA-RAD와 SLAKE에서 Med-PaLM M(12B)을 큰 차이로 능가하고 거의 PathVQA에 근접한다.
- 이미지 자막 생성에서 BiomedGPT가 PEIR GROSS에서 SOTA를 초과하고 CIDEr에서 큰 이득을 얻으며 CIDEr 개선이 데이터셋 전반에 걸쳐 강조된다.
- 11개의 MedMNIST 파생 데이터셋에서의 의료 영상 분류에서 BiomedGPT는 여러 베이스라인을 능가하며, 모델 크기가 커질수록 고해상도 데이터셋에서 주목할 만한 이득이 있다.
- BiomedGPT는 추가 태스크 특정 구성요소 없이 자유 형식의 대답을 생성하는 강력한 제로샷 VQA 능력을 시연하며, 평가의 일부에서 GPT-4V와 경쟁력 있는 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.