Skip to main content
QUICK REVIEW

[논문 리뷰] GPT-4 to GPT-3.5: 'Hold My Scalpel' -- A Look at the Competency of OpenAI's GPT on the Plastic Surgery In-Service Training Exam

Jonathan D. Freedman, Ian A. Nappier|arXiv (Cornell University)|2023. 04. 04.
Artificial Intelligence in Healthcare and Education인용 수 7
한 줄 요약

이 연구는 고도의 임상 기준인 플라스틱 수술 이너서비스 훈련 시험(PSITE)에서 GPT-4와 GPT-3.5의 성능을 평가한다. 실제 임상 사례를 포함한 정식 다중선택 문제를 사용하여, 저자들은 GPT-4가 2022년과 2021년 시험에서 각각 88번째 및 99번째 백분위수 성적을 기록함을 입증하였으며, 이는 GPT-3.5가 8번째 및 3번째 백분위수 성적을 기록한 것과 비교해 뚜렷이 뛰어난 의료 추론 능력을 보여준다. 이는 의료 추론 능력에서의 급격한 발전을 시사한다.

ABSTRACT

The Plastic Surgery In-Service Training Exam (PSITE) is an important indicator of resident proficiency and serves as a useful benchmark for evaluating OpenAI's GPT. Unlike many of the simulated tests or practice questions shown in the GPT-4 Technical Paper, the multiple-choice questions evaluated here are authentic PSITE questions. These questions offer realistic clinical vignettes that a plastic surgeon commonly encounters in practice and scores highly correlate with passing the written boards required to become a Board Certified Plastic Surgeon. Our evaluation shows dramatic improvement of GPT-4 (without vision) over GPT-3.5 with both the 2022 and 2021 exams respectively increasing the score from 8th to 88th percentile and 3rd to 99th percentile. The final results of the 2023 PSITE are set to be released on April 11, 2023, and this is an exciting moment to continue our research with a fresh exam. Our evaluation pipeline is ready for the moment that the exam is released so long as we have access via OpenAI to the GPT-4 API. With multimodal input, we may achieve superhuman performance on the 2023.

연구 동기 및 목표

  • GPT-4와 GPT-3.5의 실제 임상 기준 시험에서의 임상 추론 능력을 평가하는 것.
  • GPT 모델이 플라스틱 수술 이너서비스 훈련 시험(PSITE)에서 인간 수련의사의 성능과 유사한 성과를 달성할 수 있는지 평가하는 것.
  • 보드 자격 시험 합격과 관련이 있는 실제 임상 문제를 기반으로 기준을 제시하는 것.
  • 복잡한 도메인 특화 의료 시험에서 GPT-4와 GPT-3.5 간의 성능 격차를 조사하는 것.
  • 2023년 PSITE 시험 출시 즉시 GPT-4에 대한 향후 평가를 준비하는 것.

제안 방법

  • 연구는 2022년과 2021년 시험의 실제 PSITE 다중선택 문제를 평가 데이터셋으로 사용한다.
  • GPT-4와 GPT-3.5는 각 문제에 대해 프롬프트가 주어지고 제공된 선택지 중 가장 적절한 답을 선택하도록 요구된다.
  • 성능는 동일한 시험에서 실제 수련의사 성과의 백분위수 순위와 비교하여 측정된다.
  • 평가 파이프라인은 2023년 PSITE 시험이 출시되는 즉시 사용할 수 있도록 설계되어 있다.
  • 이 평가에서는 다중모달 입력을 사용하지 않았지만, 저자들은 향후 시각 능력이 결합될 경우 초인적 성능를 달성할 수 있음을 언급한다.
  • 결과는 이전 수련의사 성과 백분위수와 비교하여 모델 성능를 맥락화하는 데 사용된다.

실험 결과

연구 질문

  • RQ1GPT-4는 인간 플라스틱 수술 수련의사의 성능과 동일하거나 이를 초월하는 성능을 PSITE에서 달성할 수 있는가?
  • RQ2GPT-4의 성능는 동일한 임상 추론 시험에서 GPT-3.5와 비교해 어떻게 다른가?
  • RQ3GPT 모델은 복잡한 임상 사례를 포함한 실제 고도의 임상 시험 문제에 얼마나 잘 일반화되는가?
  • RQ4GPT-4와 GPT-3.5 간의 성능 격차는 의미 있는 의료 추론 능력 향상인지, 단지 통계적 변동성인지 어느 정도인가?
  • RQ5향후 GPT-4가 2023년 PSITE 시험에서 평가될 경우, 이는 LLM이 외과 전문 분야에서의 발전 추세를 더 깊이 이해하는 데 기여할 수 있는가?

주요 결과

  • GPT-4는 2022년 PSITE 시험에서 88번째 백분위수를 기록하여 인간 수련의사와 비교해 뛰어난 성능을 보였다.
  • GPT-4는 2021년 PSITE 시험에서 99번째 백분위수를 기록하여 거의 전문가 수준의 능력을 입증하였다.
  • GPT-3.5는 2022년 시험에서 뿐만 아니라 2021년 시험에서도 각각 8번째 및 3번째 백분위수를 기록하여 뚜렷이 낮은 성능를 보였다.
  • GPT-4와 GPT-3.5 간의 성능 격차는 크며, 두 시험 모두에서 GPT-4가 GPT-3.5를 80점 이상 백분위수 높이 성과를 냈다.
  • 결과는 GPT-4가 플라스틱 수술 분야에서 훈련된 인간 수련의사의 수준에 도달하거나 초월하는 임상 추론 능력을 확보했다는 것을 시사한다.
  • 평가 파이프라인은 OpenAI API를 통해 2023년 PSITE 시험이 공개되는 즉시 GPT-4에 대한 평가를 준비하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.