Skip to main content
QUICK REVIEW

[논문 리뷰] Towards a clinically accessible radiology foundation model: open-access and lightweight, with automated evaluation

Juan Manuel Zambrano Chaves, Shih-Cheng Huang|arXiv (Cornell University)|2024. 03. 12.
Radiology practices and educationMedicine인용 수 3
한 줄 요약

이 논문은 100만 건의 흉부 X-레이 영상-보고서 쌍을 기반으로 훈련된 경량 7B 파라미터 다중모달 기초 모델인 LLaVA-Rad를 소개한다. 이는 영상의학 분야의 임상 역량 격차를 메우기 위한 것이다. 오픈소스 비전 및 언어 기초 모델을 활용한 모듈러 어댑터 기반 미세조정 방식을 통해 LLaVA-Rad는 보고서 생성 및 크로스모달 검색에서 최신 기술 수준의 성능을 달성하며, GPT-4V나 Med-PaLM M과 같은 더 큰 모델들을 능가한다. 동시에 단일 V100 GPU에서 빠르고 비공개적인 추론이 가능하며, 전문가 수준에 맞는 GPT-4 기반 자동 평가가 가능하다.

ABSTRACT

The scaling laws and extraordinary performance of large foundation models motivate the development and utilization of such models in biomedicine. However, despite early promising results on some biomedical benchmarks, there are still major challenges that need to be addressed before these models can be used in real-world clinics. Frontier general-domain models such as GPT-4V still have significant performance gaps in multimodal biomedical applications. More importantly, less-acknowledged pragmatic issues, including accessibility, model cost, and tedious manual evaluation make it hard for clinicians to use state-of-the-art large models directly on private patient data. Here, we explore training open-source small multimodal models (SMMs) to bridge competency gaps for unmet clinical needs in radiology. To maximize data efficiency, we adopt a modular approach by incorporating state-of-the-art pre-trained models for image and text modalities, and focusing on training a lightweight adapter to ground each modality to the text embedding space, as exemplified by LLaVA-Med. For training, we assemble a large dataset of over 697 thousand radiology image-text pairs. For evaluation, we propose CheXprompt, a GPT-4-based metric for factuality evaluation, and demonstrate its parity with expert evaluation. For best practice, we conduct a systematic ablation study on various choices in data engineering and multimodal training. The resulting LlaVA-Rad (7B) model attains state-of-the-art results on standard radiology tasks such as report generation and cross-modal retrieval, even outperforming much larger models such as GPT-4V and Med-PaLM M (84B). The inference of LlaVA-Rad is fast and can be performed on a single V100 GPU in private settings, offering a promising state-of-the-art tool for real-world clinical applications.

연구 동기 및 목표

  • 의료 영상 AI의 임상 역량 격차를 해소하기 위해 소형이고 접근 용이하며 효율적인 다중모달 기초 모델을 개발하는 것.
  • 의료진이 개인정보 보호, 비용, 지연 시간 등의 장벽을 극복하기 위해 최신 기술 수준의 영상의학 AI 모델을 사설 환경에서 비공개로 배포할 수 있도록 하는 것.
  • 의료 영상 보고서의 사실적 정확성에 대해 전문 영상의학자가 평가하는 것과 유사한 정확도를 갖는 신뢰할 수 있는 자동 평가 프레임워크를 개발하는 것.
  • 효율적인 데이터 및 어댑터 기반 미세조정을 통해 소형 오픈소스 모델이 영상의학 과제에서 최신 기술 수준의 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • GPT-4를 활용해 정제 및 구조화된 보고서를 제공하는 8개의 다양한 출처에서 1,034,660건의 흉부 X-레이 영상-보고서 쌍으로 구성된 대규모 데이터셋을 구축한다.
  • 오픈소스 비전 및 언어 기초 모델을 조합하여 모듈러 아키텍처를 채택하고, 이미지 및 텍스트 임베딩을 정렬하기 위해 경량 어댑터만을 훈련시켜 파라미터 업데이트를 최소화한다.
  • 의료 영상 보고서의 6종류의 사실 오류를 정량화하는 새로운 GPT-4 기반 평가 지표(G-Rad)를 구현하며, 임상적으로 중요한 오류와 중요하지 않은 오류를 구분한다.
  • Kendall’s Tau b 상관계수 및 대응 t-검정을 사용해 ReXval 데이터셋에서 G-Rad가 전문 영상의학자가 기록한 오류 주석과의 일치성을 검증한다.
  • 모델 성능과 내구성을 최적화하기 위해 데이터 엔지니어링 및 훈련 설정에 대한 체계적 아블레이션 연구를 수행한다.
  • 모든 32층 및 32개 헤드의 어텐션 메커니즘을 시각화하여 모델이 텍스트 생성 과정에서 영상 영역에 어떻게 기반을 두는지 정성적으로 분석한다.

실험 결과

연구 질문

  • RQ1큰 사설 모델에 의존하지 않고도 소형 오픈소스 다중모달 모델이 영상의학 보고서 생성 및 크로스모달 검색 과제에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2GPT-4를 활용한 LLM 기반 평가 시스템(G-Rad)이 의료 영상 보고서의 임상적으로 중요한 사실 오류를 탐지하는 데 있어 전문 영상의학자 평가와 동등한 성능을 보이는가?
  • RQ3100만 건의 정제된 영상-보고서 쌍 데이터셋을 기반으로 한 경량 어댑터 기반 미세조정 방식이, GPT-4V나 Med-PaLM M과 같은 훨씬 더 큰 모델들을 임상 벤치마크에서 능가할 수 있는가?
  • RQ4모델의 어텐션 메커니즘이 흉부 X-레이의 관련 해부학적 영역과 어떻게 일치하는가? 이는 모델의 추론 과정에 대해 어떤 통찰을 제공하는가?
  • RQ5의료진이 자신의 데이터로 이러한 모델을 현지에서 미세조정할 수 있는 정도는 어느 정도이며, 효율성과 낮은 하드웨어 요구 사양을 고려할 때 가능한가?

주요 결과

  • LLaVA-Rad(7B)는 표준 영상의학 벤치마크에서 최신 기술 수준의 성능을 달성하며, 보고서 생성 및 크로스모달 검색 과제에서 GPT-4V 및 Med-PaLM M(84B) 같은 더 큰 모델들을 능가한다.
  • GPT-4-Turbo 기반의 G-Rad 평가 지표는 전문 영상의학자 평가와 강한 상관관계를 보이며, ReXval 데이터셋에서 Kendall’s Tau b 계수는 0.8를 초과한다.
  • MIMIC-CXR 테스트 세트에서 G-Rad의 임상적으로 중요한 오류 및 총 오류 수를 분석한 결과, LLaVA-Rad는 LLaVA-Med보다 2.5배, GPT-4V보다 3배 적은 임상적으로 중요한 오류를 기록한다.
  • 5대 주요 이상소견(기흉, 심장비대, 병변, 부종, 흉막출액)에 대해 CheXbert F1 점수는 0.82를 기록하며 이는 이전 최신 기술 수준의 모델들을 초월한다.
  • LLaVA-Rad는 8개의 A100 클러스터에서 단 이틀 내로 미세조정이 가능하며, 단일 V100 GPU에서 효율적으로 추론을 수행하여 임상 환경에서 비공개적이고 저지연 추론을 가능하게 한다.
  • 정성적 어텐션 시각화 결과, 모델이 생성된 단어를 관련 영상 영역에 효과적으로 기반을 두고 있음을 확인할 수 있었으며, 층과 헤드 간 일관된 어텐션 패턴을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.