Skip to main content
QUICK REVIEW

[논문 리뷰] GPT-4 Vision on Medical Image Classification -- A Case Study on COVID-19 Dataset

Ruibo Chen, Tianyi Xiong|arXiv (Cornell University)|2023. 10. 27.
COVID-19 diagnosis using AI인용 수 4
한 줄 요약

이 연구는 GPT-4V, 시각-언어 기반 모델을 사용하여 COVID-19 흉부 X선 데이터셋에서 입문자 학습을 통한 의료 영상 분류에 응용하는 것을 조사한다. 작업에 특화된 프롬프트를 설계함으로써 GPT-4V는 피넷팅된 CNN 모델인 ResNet-18 및 VGG-16와 유사한 분류 정확도를 달성하였으며, 소수의 샘플에서조차도 이를 실현하여 대규모 모델이 전통적인 데이터 집약적 학습 방식을 우회할 잠재력을 보여준다.

ABSTRACT

This technical report delves into the application of GPT-4 Vision (GPT-4V) in the nuanced realm of COVID-19 image classification, leveraging the transformative potential of in-context learning to enhance diagnostic processes.

연구 동기 및 목표

  • GPT-4V, 대규모 시각-언어 기반 모델을 사용하여 피넷팅 없이 의료 영상 분류가 가능한지 탐색하는 것.
  • 정확히 설계된 프롬프트를 사용한 입문자 학습이 소수의 샘플 설정에서 기존의 딥 러닝 모델의 성능을 따라잡거나 초월할 수 있는지 평가하는 것.
  • 프롬프트 엔지니어링, 특히 추론 설명의 포함 여부가 의료 영상 분류에서 GPT-4V의 성능에 미치는 영향을 조사하는 것.
  • 실제 세계의 COVID-19 흉부 X선 데이터셋에서 GPT-4V의 성능을 전통적인 CNN 기반 모델(ResNet-18, VGG-16)과 비교하여 전체 및 소수의 샘플 훈련 환경에서 평가하는 것.

제안 방법

  • 연구는 입력-출력 예시를 포함한 프롬프트 템플릿을 사용하여 GPT-4V를 지도하는 입문자 학습(ICL)을 활용한다.
  • 작업에 특화된 정도, 구조, 추론 근거 포함 여부에 따라 다양한 프롬프트 변형(ICL1부터 ICL4, ICL-R1, ICL-R2)을 설계하였다.
  • 임상적 맥락과 분류 규칙을 통합하여 프롬프트를 구성함으로써, GPT-4V의 사전 훈련된 지식을 활용해 제로-샷 또는 소수의 샘플에서의 적응을 가능하게 하였다.
  • 이미지는 개별적으로 처리하거나 하나의 입력 이미지로 통합하여 모델의 주의 분포 및 성능 일관성을 평가하였다.
  • 기준 모델로는 전체 데이터셋과 6개 샘플의 부분집합에서 피넷팅된 ResNet-18 및 VGG-16를 사용하여 공정한 비교를 확보하였다.
  • 평가 지표로는 테스트 세트(46장의 X선 영상, 26장의 COVID, 20장의 정상)에서의 정밀도, 재현도, F1 점수 및 총 정확도를 사용하였다.

실험 결과

연구 질문

  • RQ1GPT-4V는 피넷팅 없이도 입문자 학습만으로 의료 영상에서 경쟁 가능한 분류 정확도를 달성할 수 있는가?
  • RQ2프롬프트 설계, 특히 구조, 추론 설명 포함 여부, 이미지 통합 여부가 소수의 샘플에서 GPT-4V의 성능에 어떤 영향을 미치는가?
  • RQ3프롬프트에 추론 설명을 통합하면 GPT-4V의 의료 X선 분류 정확도가 향상되는가?
  • RQ4전체 및 소수의 샘플 훈련 조건에서 GPT-4V의 성능은 피넷팅된 CNN 모델(ResNet-18, VGG-16)과 비교해 어떻게 되는가?

주요 결과

  • ICL4 프롬프트를 사용한 GPT-4V는 총 정확도 85%를 기록하여, 6개 샘플에서 피넷팅된 ResNet-18(74%) 및 VGG-16(80%) 기준 모델을 모두 초월하였다.
  • ICL4 프롬프트 변형은 COVID 환자에 대해 F1 점수 0.85, 정상 환자에 대해 0.84를 기록하여 양 클래스 간 강력한 일반화 능력을 보였다.
  • 모든 이미지를 하나의 입력으로 통합하는 것이 개별 이미지 처리보다 성능을 향상시켰으며, 이는 GPT-4V가 더 잘 분포된 주의를 가지는 것으로 나타났다.
  • 프롬프트에 추론 설명을 추가한 ICL-R1 및 ICL-R2는 성능 향상에 기여하지 않았고, 때로는 성능 저하를 초래하여 제공된 근거와 모델의 이해 간 괴리가 존재할 수 있음을 시사하였다.
  • ICL4를 사용한 GPT-4V는 정상 클래스에 대해 정밀도 95%, 재현도 95%를 기록하여 전체 피넷팅된 ResNet-18(정밀도 95%, 재현도 90%)를 초월했으며, VGG-16 기준 모델(정밀도 100%, 재현도 92%)과 유사한 성능을 보였다.
  • 다양한 무작위 시드에서 일관된 성능을 보였으며, 평균 결과를 다섯 번의 실행에서 평균화하여 보고함으로써 소수의 샘플 설정에서의 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.