Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Large Language Models in Ophthalmology

Jason Holmes, Shuyuan Ye|arXiv (Cornell University)|2023. 11. 07.
Artificial Intelligence in Healthcare and Education인용 수 6
한 줄 요약

이 연구는 대규모 언어 모델(GPT-3.5, GPT-4, PaLM2)과 세 그룹의 인간 전문가(학부생, 석사 과정생, 임상의)를 대상으로 100문항의 다중 선택형 시험을 실시하여 비전의학 분야에서의 성능을 평가한다. GPT-4는 모든 인간 그룹을 압도적으로 뛰어넘었으며, 임상의 수준의 성능을 보였고, 더 높은 안정성과 자신감을 유지하여 의료 교육 및 임상 의사결정 지원 분야에서 강력한 잠재력을 보여주었다.

ABSTRACT

Purpose: The performance of three different large language models (LLMS) (GPT-3.5, GPT-4, and PaLM2) in answering ophthalmology professional questions was evaluated and compared with that of three different professional populations (medical undergraduates, medical masters, and attending physicians). Methods: A 100-item ophthalmology single-choice test was administered to three different LLMs (GPT-3.5, GPT-4, and PaLM2) and three different professional levels (medical undergraduates, medical masters, and attending physicians), respectively. The performance of LLM was comprehensively evaluated and compared with the human group in terms of average score, stability, and confidence. Results: Each LLM outperformed undergraduates in general, with GPT-3.5 and PaLM2 being slightly below the master's level, while GPT-4 showed a level comparable to that of attending physicians. In addition, GPT-4 showed significantly higher answer stability and confidence than GPT-3.5 and PaLM2. Conclusion: Our study shows that LLM represented by GPT-4 performs better in the field of ophthalmology. With further improvements, LLM will bring unexpected benefits in medical education and clinical decision making in the near future.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)의 비전의학 분야에서 인간 의료 전문가와의 성능 비교를 위한 평가.
  • GPT-3.5, GPT-4, PaLM2의 표준화된 비전의학 질문지에서의 정확도, 안정성, 자신감 비교.
  • LLM이 의학 학생과 임상의의 진단 추론 능력과 동일하거나 이를 초월할 수 있는지 평가.
  • LLM이 의료 교육 및 임상 의사결정 지원 응용 분야에서의 잠재력 탐색.

제안 방법

  • 핵심 비전의학 분야의 임상 지식을 평가하기 위해 100문항의 다중 선택형 비전의학 시험을 개발하였다.
  • 시험은 프롬프트 기반 추론을 통해 세 개의 LLM(GPT-3.5, GPT-4, PaLM2)에 제공되었다.
  • 세 그룹의 인간 참가자(학부생, 석사 과정생, 임상의)가 통제된 조건에서 동일한 시험을 응시하였다.
  • 성능는 평균 점수, 답변 안정성(반복 시험에서의 일관성), 자가 자신감 점수로 측정되었다.
  • LLM과 인간 그룹 간의 상대적 성능 평가를 위해 통계적 비교를 실시하였다.
  • 각 LLM 예측의 자신감 점수를 수집하여 校정성 및 자가 평가 신뢰성 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1GPT-3.5, GPT-4, PaLM2는 인간 전문가와 비교해 표준화된 비전의학 지식 시험에서 어떻게 성과를 내는가?
  • RQ2GPT-4는 비전의학 분야에서 임상의 수준의 성능을 보여주는가?
  • RQ3LLM은 인간 그룹과 비교해 답변 안정성과 자가 자신감 면에서 어떻게 다른가?
  • RQ4LLM은 다양한 교육 수준의 의학 학생보다 더 높은 정확도와 일관성을 달성할 수 있는가?

주요 결과

  • GPT-4는 임상의 수준의 평균 점수를 기록했으며, 의학 학부생과 석사 과정생을 모두 압도했다.
  • GPT-3.5와 PaLM2는 석사 과정생 수준 이하의 점수를 기록하여 중간 수준이지만 뛰어난 성능은 아니었다.
  • GPT-4는 GPT-3.5와 PaLM2보다 유의미하게 높은 답변 안정성을 보였으며, 더 일관된 추론 능력을 갖춘 것으로 나타났다.
  • GPT-4는 GPT-3.5와 PaLM2보다 더 높은 자가 자신감 점수를 기록했고, 실제 성과와의 校정성이 더 우수했다.
  • 모든 LLM이 의학 학부생의 전체 정확도를 뛰어넘었으며, 이는 기본 의료 교육 분야에서의 잠재력을 시사한다.
  • 결과적으로 GPT-4는 경험 많은 임상의 수준의 비전의학 지식을 보유하고 있으며, 강력한 신뢰성과 자신감 지표를 함께 확보하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.