Skip to main content
QUICK REVIEW

[논문 리뷰] The Potential and Pitfalls of using a Large Language Model such as ChatGPT or GPT-4 as a Clinical Assistant

Jingqing Zhang, Kai Sun|arXiv (Cornell University)|2023. 07. 16.
Artificial Intelligence in Healthcare and Education인용 수 7
한 줄 요약

이 연구는 실제 전자건강기록과 시뮬레이션 환자 사례를 사용하여 GPT-4와 ChatGPT를 임상 보조자로 평가한다. GPT-4는 사고의 흐름과 소수의 예제를 활용한 프롬프트 기반으로 질병 분류에서 최대 96%의 F1 스코어를 달성하지만, 사실 오류, 빠진 발견 및 과잉 치료 위험을 보이며, 확장 가능성은 있으나 현재 임상적 유용성은 제한된다.

ABSTRACT

Recent studies have demonstrated promising performance of ChatGPT and GPT-4 on several medical domain tasks. However, none have assessed its performance using a large-scale real-world electronic health record database, nor have evaluated its utility in providing clinical diagnostic assistance for patients across a full range of disease presentation. We performed two analyses using ChatGPT and GPT-4, one to identify patients with specific medical diagnoses using a real-world large electronic health record database and the other, in providing diagnostic assistance to healthcare workers in the prospective evaluation of hypothetical patients. Our results show that GPT-4 across disease classification tasks with chain of thought and few-shot prompting can achieve performance as high as 96% F1 scores. For patient assessment, GPT-4 can accurately diagnose three out of four times. However, there were mentions of factually incorrect statements, overlooking crucial medical findings, recommendations for unnecessary investigations and overtreatment. These issues coupled with privacy concerns, make these models currently inadequate for real world clinical use. However, limited data and time needed for prompt engineering in comparison to configuration of conventional machine learning workflows highlight their potential for scalability across healthcare applications.

연구 동기 및 목표

  • 대규모 실생활 전자건강기록(EHR) 데이터베이스를 사용하여 GPT-4와 ChatGPT의 특정 의료 진단을 가진 환자를 식별하는 성능을 평가하기 위해.
  • 이러한 대규모 언어모델이 가상의 환자 사례에 대해 임상 전문가에게 진단 보조를 제공하는 데의 유용성을 평가하기 위해.
  • LLM을 임상 환경에 도입할 때 발생할 수 있는 개인정보 유출 위험과 같은 윤리적 문제를 포함한 사실 오류, 임상적 추론 결함을 식별하고 분석하기 위해.
  • 전통적인 기계학습 워크플로우 대비 프롬프트 엔지니어링의 자원(시간 및 데이터) 요구량을 비교하여 확장 가능성 평가하기 위해.

제안 방법

  • GPT-4에 사고의 흐름과 소수의 예제 프롬프트를 적용하여 실생활 EHR 데이터베이스를 기반으로 한 질병 분류 모델을 훈련 및 평가하기 위해 후향적 분석을 수행하였다.
  • GPT-4가 임상 기록과 증상 기반으로 가상의 환자 사례를 평가하도록 프롬프트한 전향적 시뮬레이션 연구를 설계하였다.
  • 분류 작업에서 모델의 일관성과 진단 정확도 향상을 위해 소수의 예제 프롬프트와 사고의 흐름 추론을 활용하였다.
  • 골드스탠다드 임상 진단과 비교하여 모델 출력을 평가하여 F1 스코어를 산출하고 임상적 추론 품질을 평가하였다.
  • 모델 출력에서 발생한 오류를 식별하고 분류하였으며, 사실 오류, 중요한 발견 누락, 불필요한 검사나 치료 권고 포함.
  • LLM 상호작용을 통한 EHR 데이터 노출로 인한 개인정보 및 보안 문제를 평가하였다.

실험 결과

연구 질문

  • RQ1GPT-4는 프롬프트 엔지니어링 기법을 사용하여 실생활 EHR 데이터에서 질병 분류에 높은 진단 정확도를 달성할 수 있는가?
  • RQ2GPT-4는 표준 임상적 추론과 비교해 볼 때, 가상의 환자 사례에 대해 임상 진단 보조를 제공하는 데 어떻게 성능을 발휘하는가?
  • RQ3GPT-4를 임상 보조자로 사용할 경우 발생하는 사실적, 임상적, 윤리적 오류의 유형은 무엇인가?
  • RQ4의료 분야에서 전통적인 기계학습 워크플로우 개발 대비 프롬프트 엔지니어링의 자원(데이터 및 시간) 요구량은 어떻게 비교되는가?

주요 결과

  • GPT-4는 실생활 EHR 데이터에서 사고의 흐름과 소수의 예제 프롬프트를 사용할 경우 질병 분류 작업에서 최대 96%의 F1 스코어를 기록하였다.
  • 전향적 환자 사례 평가에서 GPT-4는 네 건의 사례 중 세 건을 정확히 진단하여 강력한 진단 잠재력을 보였다.
  • 모델은 상당수의 응답에서 사실 오류를 유발하였으며, 임상적 발견과 지침을 잘못 해석하거나 왜곡하는 경우가 있었다.
  • 모델은 환자 개요에서 금기사항이나 공존 질환과 같은 중요한 의료 정보를 자주 간과하였다.
  • 여러 사례에서 불필요한 검사나 치료를 권고하여 과잉 치료 위험이 있음을 보여주었다.
  • 개인정보 유출 우려가 여전히 주요 장벽으로 남아 있으며, LLM 상호작용을 통해 민감한 EHR 데이터가 노출될 수 있어 실생활 도입에 제약이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.