[논문 리뷰] A ChatGPT Aided Explainable Framework for Zero-Shot Medical Image Diagnosis
본 논문은 학습 없이도 정확도와 해석가능성을 향상시키기 위해 ChatGPT가 생성한 시각적 증상 프롬프트로 보강된 CLIP 기반 제로샷 의료 영상 분류 프레임워크를 제안하고, 다섯 개의 의료 데이터셋에서 평가한다.
Zero-shot medical image classification is a critical process in real-world scenarios where we have limited access to all possible diseases or large-scale annotated data. It involves computing similarity scores between a query medical image and possible disease categories to determine the diagnostic result. Recent advances in pretrained vision-language models (VLMs) such as CLIP have shown great performance for zero-shot natural image recognition and exhibit benefits in medical applications. However, an explainable zero-shot medical image recognition framework with promising performance is yet under development. In this paper, we propose a novel CLIP-based zero-shot medical image classification framework supplemented with ChatGPT for explainable diagnosis, mimicking the diagnostic process performed by human experts. The key idea is to query large language models (LLMs) with category names to automatically generate additional cues and knowledge, such as disease symptoms or descriptions other than a single category name, to help provide more accurate and explainable diagnosis in CLIP. We further design specific prompts to enhance the quality of generated texts by ChatGPT that describe visual medical features. Extensive results on one private dataset and four public datasets along with detailed analysis demonstrate the effectiveness and explainability of our training-free zero-shot diagnosis pipeline, corroborating the great potential of VLMs and LLMs for medical applications.
연구 동기 및 목표
- 대형 언어 모델(ChatGPT)과 비전-언어 모델(CLIP)을 통합하여 제로샷 의료 영상 진단의 실현 가능성을 입증한다.
- 질병별 시각적 증상을 생성하여 CLIP 기반 분류의 설명가능성을 향상시킨다.
- 다양한 의료 데이터셋에 걸쳐 제안된 프레임워크를 평가하여 정확도 향상과 해석가능성을 평가한다.
- 성능과 설명에 영향을 주는 프롬프트 설계 및 집계 전략을 조사한다.
제안 방법
- CLIP를 사용하여 의료 영상에서 시각적 특징을 추출하고 텍스트 표현과의 유사도를 계산한다.
- 설계된 프롬프트로 ChatGPT에 질의하여 진단에 유용한 특징을 설명하는 질병별 시각적 증상을 생성한다.
- ChatGPT가 생성한 증상 텍스트를 CLIP의 텍스트 인코더로 인코딩하고 증상 간 유사도 점수를 집계하여 질병별 최종 점수를 얻는다.
- 이미지 특징과 증상 텍스트 간 평균 유사도가 가장 높은 범주를 선택하여 최종 진단을 계산한다.
- 의학적으로 관련된 특징 강조와 문헌에의 근거를 강화하도록 프롬프트를 설계하여 기술의 질을 향상시키고 환각을 줄인다.
- 집계 전략(mean vs max)과 프롬프트 설계를 비교하고 베이스라인으로 OpenFlamingo와 대조한다.
실험 결과
연구 질문
- RQ1CLIP와 함께 사용할 때 ChatGPT가 생성한 질병 증상이 제로샷 의료 영상 분류를 개선할 수 있는가?
- RQ2프롬프트 설계가 CLIP-LLM 파이프라인의 설명 품질과 진단 정확도에 어떤 영향을 미치는가?
- RQ3어떤 집계 전략(mean vs max)이 의료 데이터셋에서 더 나은 제로샷 진단 성능을 보여주는가?
- RQ4제안된 방법이 OpenFlamingo와 같은 공개 다중모달 모델과 의료 진단 작업에서 어떻게 비교되는가?
주요 결과
- 본 방법은 다섯 데이터셋 모두에서 표준 CLIP 제로샷 분류에 비해 일관된 개선을 보인다.
- 폐렴 데이터셋에서 이 접근법은 카테고리 이름만을 사용하는 CLIP에 비해 정확도를 최대 11.73포인트 향상시킨다.
- Shenzhen 데이터셋에서 정확도가 최대 17.37포인트 향상된다.
- OpenFlamingo와 비교하면 본 프레임워크는 대부분의 데이터셋에서 2.59%에서 5.80%의 이점을 보이며 BrainTumor에서 5.59%의 이득을 보인다.
- 설계된 프롬프트를 사용하면 다섯 개 데이터셋 중 네 개에서 기준 프롬프트보다 정확도가 향상되어 프롬프트 엔지니어링의 영향을 보여준다.
- 이 방법은 이미지 영역과 ChatGPT가 생성한 증상 간의 정렬을 보여주는 해석 가능한 주의 맵을 제공하여 설명가능성을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.