Skip to main content
QUICK REVIEW

[논문 리뷰] ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders

Shawn Xu, Lin Yang|arXiv (Cornell University)|2023. 08. 02.
COVID-19 diagnosis using AI인용 수 18
한 줄 요약

ELIXR은 고정된 LLM과 시각 인코더를 정렬하여 짝지어진 이미지와 자유 텍스트 보고서를 사용한 흉부 X선 사진에서 제로샷 분류, 데이터 효율적 학습, 의미 검색, VQA 및 방사선 보고서 QA를 가능하게 한다.

ABSTRACT

In this work, we present an approach, which we call Embeddings for Language/Image-aligned X-Rays, or ELIXR, that leverages a language-aligned image encoder combined or grafted onto a fixed LLM, PaLM 2, to perform a broad range of chest X-ray tasks. We train this lightweight adapter architecture using images paired with corresponding free-text radiology reports from the MIMIC-CXR dataset. ELIXR achieved state-of-the-art performance on zero-shot chest X-ray (CXR) classification (mean AUC of 0.850 across 13 findings), data-efficient CXR classification (mean AUCs of 0.893 and 0.898 across five findings (atelectasis, cardiomegaly, consolidation, pleural effusion, and pulmonary edema) for 1% (~2,200 images) and 10% (~22,000 images) training data), and semantic search (0.76 normalized discounted cumulative gain (NDCG) across nineteen queries, including perfect retrieval on twelve of them). Compared to existing data-efficient methods including supervised contrastive learning (SupCon), ELIXR required two orders of magnitude less data to reach similar performance. ELIXR also showed promise on CXR vision-language tasks, demonstrating overall accuracies of 58.7% and 62.5% on visual question answering and report quality assurance tasks, respectively. These results suggest that ELIXR is a robust and versatile approach to CXR AI.

연구 동기 및 목표

  • 정형적으로 수집되는 흉부 X선(CXR) 이미지-보고서 쌍을 활용하여 다양한 방사선 작업에 작동하는 다중모달 모델을 학습한다.
  • Rich한 텍스트 가이드를 통한 CXR 분류에서 강력한 제로샷 및 데이터 효율적 성능을 달성한다.
  • LMM 정렬을 통해 의미 검색, 시각적 질문 응답, 방사선 보고서 QA와 같은 다중모달 기능을 활성화한다.

제안 방법

  • 두 단계 아키텍처: ELIXR-C는 CLIP 스타일 대조 학습을 사용하여 CXR 이미지를 방사선 보고서와 정렬하는 언어 정렬 이미지 인코더를 훈련한다.
  • ELIXR-B는 고정된 ELIXR-C 인코더와 고정된 LLM(PaLM 2-S) 사이에 경량 어댑터(Q-Former)를 삽입하여 이미지 임베딩을 LLM의 토큰 공간에 매핑한다.
  • 어댐터만 학습하고 LLM 및 시각 인코더는 고정하여 데이터 효율적으로 훈련한다.
  • Phase 1은 이미지-텍스트 대조 학습(ITC), 이미지-기반 텍스트 생성(ITG), 이미지-텍스트 매칭(ITM)을 사용하여 교차 모달 표현을 학습한다.
  • Phase 2는 LLM-정렬 토큰 생성을 가능하게 하고 인상(impression) 생성을 가능하게 한 다음 VQA 및 보고서 QA와 같은 다운스트림 생성 작업에 LLM을 활용한다.

실험 결과

연구 질문

  • RQ1ELIXR이 최첨단 감독 방식과 비교할 만한 흉부 X선 소견의 제로샷 분류 성능을 달성할 수 있는가?
  • RQ2ELIXR-C 및 ELIXR-B를 사용할 때 CXR 분류의 데이터 효율성은 완전 감독 기준선과 비교해 얼마나 높을 수 있는가?
  • RQ3ELIXR 프레임워크가 의미 검색을 지원하고 임상적으로 관련된 CXR 이미지를 높은 품질로 검색할 수 있는가?
  • RQ4ELIXR이 LLM-정렬 다중모달 파이프라인을 사용한 VQA 및 방사선 보고서 품질 보증을 수행할 수 있는가?
  • RQ5다양한 데이터셋과 병원 소스에 걸쳐 방법이 일반화되는가?

주요 결과

  • ELIXR은 CheXpert에서 13개 소견에 대해 평균 AUC 0.850의 제로샷 분류에서 최첨단 수준을 달성한다.
  • ELIXR-C 및 ELIXR-B는 5개 CheXpert 소견에서 데이터 1%로 평균 AUC 0.893, 데이터 10%로 평균 AUC 0.898의 데이터 효율적 선형 탐색 성능을 달성하여 기존 방법을 상회한다.
  • 의미 검색의 경우 ELIXR은 19개 질의에서 0.76 NDCG@5를 달성하고 여러 개의 완벽한 검색 결과를 얻었다(질의 중 12개에서).
  • ELIXR-B는 검색 품질에서 ELIXR-C 및 MedCLIP를 능가하여 질의 그룹별로 더 높은 precision@5 및 NDCG@5를 달성한다.
  • VQA 및 보고서 QA 작업에서 ELIXR은 CXR 작업에서 전반적으로 정확도 58.7%(VQA) 및 62.5%(보고서 QA)를 나타낸다.
  • 기존의 데이터 효율적 방법과 비교하여 ELIXR은 유사한 성능을 달성하기 위해 필요한 데이터 양이 두 자릿수 차이 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.