[논문 리뷰] CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images
CXR-LLAVA는 흉부 X선을 해석할 수 있는 오픈소스 다중모달 대규모 언어 모델로, 시각 트랜스포머와 대규모 언어 모델을 통합하여 개발되었다. 592,580장의 CXR 데이터로 훈련하고 자유형 텍스트 영상의학 보고서로 미세조정한 결과, 내부 테스트 세트에서 F1 스코어 0.81, 외부 테스트 세트에서 0.62를 기록하여 GPT-4-비전 및 제니니-프로-비전을 능가했으며, 인간 영상의사가 수행하는 자율 보고에서 72.7%의 성공률을 기록했다.
Purpose: This study aimed to develop an open-source multimodal large language model (CXR-LLAVA) for interpreting chest X-ray images (CXRs), leveraging recent advances in large language models (LLMs) to potentially replicate the image interpretation skills of human radiologists Materials and Methods: For training, we collected 592,580 publicly available CXRs, of which 374,881 had labels for certain radiographic abnormalities (Dataset 1) and 217,699 provided free-text radiology reports (Dataset 2). After pre-training a vision transformer with Dataset 1, we integrated it with an LLM influenced by the LLAVA network. Then, the model was fine-tuned, primarily using Dataset 2. The model's diagnostic performance for major pathological findings was evaluated, along with the acceptability of radiologic reports by human radiologists, to gauge its potential for autonomous reporting. Results: The model demonstrated impressive performance in test sets, achieving an average F1 score of 0.81 for six major pathological findings in the MIMIC internal test set and 0.62 for seven major pathological findings in the external test set. The model's F1 scores surpassed those of GPT-4-vision and Gemini-Pro-Vision in both test sets. In human radiologist evaluations of the external test set, the model achieved a 72.7% success rate in autonomous reporting, slightly below the 84.0% rate of ground truth reports. Conclusion: This study highlights the significant potential of multimodal LLMs for CXR interpretation, while also acknowledging the performance limitations. Despite these challenges, we believe that making our model open-source will catalyze further research, expanding its effectiveness and applicability in various clinical contexts. CXR-LLAVA is available at https://github.com/ECOFRI/CXR_LLAVA.
연구 동기 및 목표
- 영상의학 전문의 수준의 성능을 갖춘 흉부 X선 영상 해석이 가능한 다중모달 대규모 언어 모델을 개발하는 것.
- 라벨이 부여된 이상 소견과 자유형 텍스트 영상의학 보고서를 모두 포함한 공개된 CXR 데이터셋을 활용하여 훈련하는 것.
- LLM를 활용하여 자동 영상의학 보고의 정확도와 품질을 향상시켜 진단 정확도를 개선하는 것.
- 의료 영상 AI 분야의 연구 및 임상 적용을 가속화하는 데 기여할 수 있는 오픈소스 모델을 구축하는 것.
- 실제 임상 환경에서의 테스트 시나리오에서 최신의 비전-언어 모델과의 성능 비교를 수행하는 것.
제안 방법
- 라벨이 부여된 영상학적 이상 소견이 포함된 374,881장의 CXR 데이터로 시각 트랜스포머를 사전 훈련함 (데이터셋 1).
- LLAVA 아키텍처를 영감으로 삼아 시각 인코더를 대규모 언어 모델과 통합하여 다중모달 기초 모델을 구성함.
- 자유형 텍스트 영상의학 보고서가 포함된 217,699장의 CXR 데이터로 주로 미세조정함 (데이터셋 2).
- 사전 훈련 단계에서 시각적 표현과 텍스트 표현 간의 정렬을 위해 대비 학습 목표를 사용함.
- 미세조정 단계에서 영상-언어 지시 훈련 전략을 적용하여 보고서 생성 및 진단 추론 능력을 향상시킴.
- 인간 영상의사 평가를 통해 진단 분류 및 보고서 품질을 평가함.
실험 결과
연구 질문
- RQ1다양한 CXR 데이터로 훈련된 다중모달 LLM이 인간 영상의사 수준의 진단 성능을 달성할 수 있는가?
- RQ2CXR-LLAVA는 GPT-4-비전 및 제니니-프로-비전과 같은 최신 비전-언어 모델과 비교해 흉부 X선 해석 과제에서 어떤 성능을 보이는가?
- RQ3CXR-LLAVA는 임상적으로 수용 가능한 자율 영상의학 보고서를 얼마나 잘 생성할 수 있는가?
- RQ4라벨이 부여된 이상 소견과 자유형 텍스트 보고서를 동시에 사용할 경우, 다중모달 의료 LLM의 훈련에 어떤 영향을 미치는가?
- RQ5CXR-LLAVA를 오픈소스로 공개하면 의료 영상 AI 분야의 혁신이 얼마나 가속화될 수 있는가?
주요 결과
- CXR-LLAVA는 MIMIC 내부 테스트 세트에서 6개 주요 병리 소견에 대해 평균 F1 스코어 0.81을 기록함.
- 외부 테스트 세트에서는 7개 주요 병리 소견에 대해 F1 스코어 0.62를 기록하여 GPT-4-비전 및 제니니-프로-비전을 모두 능가함.
- 인간 영상의사 평가에서 모델은 자율 보고 성공률 72.7%를 기록하였으며, 기준값 보고서(84.0%)에 비해 낮지만 우수한 성능를 보임.
- 내부 및 외부 테스트 세트 전반에서 GPT-4-비전 및 제니니-프로-비전보다 일관되게 높은 성능를 기록함.
- LLAVA를 기반으로 한 아키텍처를 통해 시각 트랜스포머와 대규모 언어 모델을 통합함으로써, CXR 해석 과제에서 강력한 제로샷 및 피셔샷 일반화 능력을 확보함.
- CXR-LLAVA의 오픈소스화는 의료 영상 AI 분야의 향후 연구 및 임상 적용을 촉진할 것으로 기대됨.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.