Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of ChatGPT-Generated Medical Responses: A Systematic Review and Meta-Analysis

Qiuhong Wei, Zhengxiong Yao|arXiv (Cornell University)|2023. 10. 12.
Artificial Intelligence in Healthcare and Education인용 수 5
한 줄 요약

이 체계적 리뷰 및 메타분석은 3520篇의 논문에서 특정된 17개의 연구를 바탕으로 ChatGPT의 의료 질문에 대한 성능을 평가한다. 전체 통합 정확도는 56% (95% 신뢰구간: 51%-60%, I² = 87%)로 보고되었으며, 이는 연구 간 상당한 이질성과 일관되지 않은 보고로 인해 신뢰도가 제한되며, 향후 연구에서 표준화되고 투명한 평가 프레임워크의 필요성을 제기한다.

ABSTRACT

Large language models such as ChatGPT are increasingly explored in medical domains. However, the absence of standard guidelines for performance evaluation has led to methodological inconsistencies. This study aims to summarize the available evidence on evaluating ChatGPT's performance in medicine and provide direction for future research. We searched ten medical literature databases on June 15, 2023, using the keyword "ChatGPT". A total of 3520 articles were identified, of which 60 were reviewed and summarized in this paper and 17 were included in the meta-analysis. The analysis showed that ChatGPT displayed an overall integrated accuracy of 56% (95% CI: 51%-60%, I2 = 87%) in addressing medical queries. However, the studies varied in question resource, question-asking process, and evaluation metrics. Moreover, many studies failed to report methodological details, including the version of ChatGPT and whether each question was used independently or repeatedly. Our findings revealed that although ChatGPT demonstrated considerable potential for application in healthcare, the heterogeneity of the studies and insufficient reporting may affect the reliability of these results. Further well-designed studies with comprehensive and transparent reporting are needed to evaluate ChatGPT's performance in medicine.

연구 동기 및 목표

  • ChatGPT의 의료 맥락에서의 성능에 대한 기존 증거를 요약하기 위해.
  • 의료 질의에 대한 ChatGPT 평가 연구에서 발견된 방법론적 일관성 없는 점을 규명하기 위해.
  • 다양한 연구 간 보고된 성능 지표의 신뢰성과 타당성 평가를 위해.
  • 보고 및 연구 설계의 격차를 바탕으로 향후 연구를 위한 권고안을 제시하기 위해.
  • 의료 분야에서 대규모 언어 모델의 표준화된 평가를 위한 기반을 마련하기 위해.

제안 방법

  • 2023년 6월 15일 기준으로 10개의 의료 데이터베이스에서 'ChatGPT'라는 키워드를 사용해 체계적 문헌 검색을 수행하였다.
  • 사전 정의된 포함 기준에 따라 연구를 선별하고, 최종적으로 60개의 연구를 검토하고 메타분석에 17개의 연구를 포함하였다.
  • 랜덤 효과 모델을 사용해 연구 간 통합 정확도를 추정하고, 95% 신뢰구간과 이질성에 대한 I² 통계치를 산출하였다.
  • ChatGPT 버전, 질문 반복 여부, 질문 출처 등의 방법론적 품질 평가를 수행하였다.
  • 연구 간 정확도, 일관성, 투명성에 대한 결과를 종합하였다.
  • 최종 결과는 2024년 Volume 151에 게재된 Journal of Biomedical Informatics를 표적 출판처로 하였다.

실험 결과

연구 질문

  • RQ1기존 연구들에서 ChatGPT의 의료 질문에 대한 총괄 정확도는 얼마인가?
  • RQ2의료 분야에서 ChatGPT를 평가하는 데 사용된 평가 방법은 얼마나 일관된가?
  • RQ3방법론적 보고의 격차가 성능 추정의 신뢰성에 어느 정도 영향을 미치는가?
  • RQ4연구 간 질문 출처, 프롬프트 전략, 평가 지표의 주요 차이는 무엇인가?
  • RQ5향후 평가의 표준화와 투명성을 향상시키기 위해 도출할 수 있는 권고안은 무엇인가?

주요 결과

  • 포괄된 연구들에서 ChatGPT는 의료 질의에 대한 총괄 통합 정확도 56% (95% 신뢰구간: 51%-60%)를 보였다.
  • 연구 간 상당한 이질성이 관찰되었으며, I² 통계치는 87%로 결과의 상당한 일관성 부족을 시사하였다.
  • 많은 연구들이 핵심 방법론적 세부 정보를 보고하지 않았으며, 사용된 ChatGPT의 구체적 버전, 질문 재사용 여부 또는 독립적 처리 여부가 명시되지 않았다.
  • 보고 품질은 일관되지 않았으며, 평가 프로토콜과 데이터 수집 절차에 대한 투명성이 부족하였다.
  • 매력적인 잠재력을 지녔음에도 불구하고, 현재의 증거 기반은 방법론적 변동성과 열악한 보고로 인해 손상되어 집계된 성능 추정의 신뢰도가 낮아졌다.
  • 이러한 결과는 임상 환경에서 LLM의 표준화되고 투명하며 잘 설계된 평가 프레임워크의 긴급한 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.