Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal ChatGPT for Medical Applications: an Experimental Study of GPT-4V

Zhiling Yan, Kai Zhang|arXiv (Cornell University)|2023. 10. 29.
Artificial Intelligence in Healthcare and Education인용 수 33
한 줄 요약

본 논문은 11가지 모달리티와 15개의 객체로 구성된 병리학 및 영상의학 데이터셋에서 GPT-4V의 의학 시각적 질문 응답(VQA)을 평가하고, 현 시점의 GPT-4V가 실제 진단에 신뢰할 수 없음을 발견하며 7가지 행동 양상을 식별한다.

ABSTRACT

In this paper, we critically evaluate the capabilities of the state-of-the-art multimodal large language model, i.e., GPT-4 with Vision (GPT-4V), on Visual Question Answering (VQA) task. Our experiments thoroughly assess GPT-4V's proficiency in answering questions paired with images using both pathology and radiology datasets from 11 modalities (e.g. Microscopy, Dermoscopy, X-ray, CT, etc.) and fifteen objects of interests (brain, liver, lung, etc.). Our datasets encompass a comprehensive range of medical inquiries, including sixteen distinct question types. Throughout our evaluations, we devised textual prompts for GPT-4V, directing it to synergize visual and textual information. The experiments with accuracy score conclude that the current version of GPT-4V is not recommended for real-world diagnostics due to its unreliable and suboptimal accuracy in responding to diagnostic medical questions. In addition, we delineate seven unique facets of GPT-4V's behavior in medical VQA, highlighting its constraints within this complex arena. The complete details of our evaluation cases are accessible at https://github.com/ZhilingYan/GPT4V-Medical-Report.

연구 동기 및 목표

  • 여러 영상 모달리티와 기관에 걸친 시각적으로 쌍을 이루는 의료 질문에 GPT-4V가 답할 수 있는 능력을 평가한다.
  • 의료 질의에 대한 위치 식별(localization), 크기 추정, 이미지와 텍스트의 통합을 GPT-4V의 특성으로 설명한다.
  • 의료 VQA 맥 context에서 GPT-4V의 강점, 한계 및 행동 패턴을 식별한다.
  • 의료 맥락에서 GPT-4V가 언제 어떻게 도움이 되거나 오도할 수 있는지에 대한 지침을 제공한다.

제안 방법

  • PathVQA, VQA-RAD, PMC-VQA의 사례에 대해 이미지 입력과 함께 ChatGPT 인터페이스를 통해 zero-shot 프롬프트로 GPT-4V를 질의한다.
  • 정답 라벨을 사용하여 닫힌 형식(객관식)과 주관식 질문의 정확도를 평가한다.
  • 병리학과 영상의학에 걸친 16가지 질문 유형으로 133개의 샘플을 11가지 모달리티와 15개의 객체에 걸쳐 선별한다.
  • 난이도 수준(easy, medium, hard)과 특정 질문 유형(모달리티 인식, 위치 식별, 크기 등)에 따른 성능을 분석한다.
  • 의료 VQA에서 GPT-4V의 행동의 7가지 측면을 식별한다. 여기에는 신호 의존성, 크기 추정의 어려움, 텍스트 편향 등이 포함된다.

실험 결과

연구 질문

  • RQ1GPT-4V가 병리학 및 영상의학 이미지에서 의료 영상 모달리티를 인식하고 객체를 위치 식별할 수 있는가?
  • RQ2제로샷 설정에서 의료 VQA에 대한 GPT-4V의 정확도는 얼마나 되며, 질문 유형과 난이도에 따라 어떻게 달라지는가?
  • RQ3의료 VQA에 적용했을 때 GPT-4V의 주요 한계와 행동 패턴은 무엇인가?
  • RQ4VQA 성능을 토대로 GPT-4V가 실제 진단 지원에 적합한가?

주요 결과

  • 전반적인 병리학 VQA 정확도는 29.9%, 닫힌 형식 질문에서 35.3%이다.
  • 영상의학 VQA는 전체 정확도 50.0%를 달성하며, 쉬운 문제 81.25%, 중간 59.09%, 어려운 11.11%이다.
  • GPT-4V는 쉬운 질문에서 더 나은 성능을 보이나, 더 어려운 다중 슬라이스 및 크기 추정 작업에서 어려움을 겪는다.
  • GPT-4V는 시각 데이터보다 텍스트 컨텍스트에 의존하는 경향이 있어 편향되거나 불완전한 해석으로 이어진다.
  • 모델은 신중한 경향이 있어 자주 자신이 의학 전문가는 아니며 길고 설명적인 응답을 제공한다.
  • 연구는 신뢰할 수 없는 정확도 때문에 GPT-4V를 실제 진단 사용에 권장하지 않는다고 결론지었다.
  • 의료 VQA에서 GPT-4V의 7가지 구별되는 행동 양상이 식별되고 논의된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.