Skip to main content
QUICK REVIEW

[논문 리뷰] MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models

Yan Cai, Linlin Wang|arXiv (Cornell University)|2023. 12. 20.
Topic Modeling인용 수 4
한 줄 요약

MedBench는 중국 의료 자격시험과 실제 임상 사례에서 유래한 총 40,041개의 중국어 의료 질문으로 구성된 대규모 다중 출처 기준 평가 기준으로, 중국어 의료 LLM의 지식과 추론 능력을 중국 의료 교육 전반에 걸쳐 평가하기 위해 제작되었다. 이는 중국어 의료 LLM이 상당한 성능 부족을 보이며, ChatGPT와 같은 일부 일반 도메인 모델은 강력한 의료 지식을 보여주어 진단 추론 및 정확도 측면에서 뚜렷한 격차를 드러낸다.

ABSTRACT

The emergence of various medical large language models (LLMs) in the medical domain has highlighted the need for unified evaluation standards, as manual evaluation of LLMs proves to be time-consuming and labor-intensive. To address this issue, we introduce MedBench, a comprehensive benchmark for the Chinese medical domain, comprising 40,041 questions sourced from authentic examination exercises and medical reports of diverse branches of medicine. In particular, this benchmark is composed of four key components: the Chinese Medical Licensing Examination, the Resident Standardization Training Examination, the Doctor In-Charge Qualification Examination, and real-world clinic cases encompassing examinations, diagnoses, and treatments. MedBench replicates the educational progression and clinical practice experiences of doctors in Mainland China, thereby establishing itself as a credible benchmark for assessing the mastery of knowledge and reasoning abilities in medical language learning models. We perform extensive experiments and conduct an in-depth analysis from diverse perspectives, which culminate in the following findings: (1) Chinese medical LLMs underperform on this benchmark, highlighting the need for significant advances in clinical knowledge and diagnostic precision. (2) Several general-domain LLMs surprisingly possess considerable medical knowledge. These findings elucidate both the capabilities and limitations of LLMs within the context of MedBench, with the ultimate goal of aiding the medical research community.

연구 동기 및 목표

  • 중국어 의료 LLM에 대한 표준화되고 대규모의 평가 기준이 부족한 문제를 해결하기 위해, 실제 임상 및 교육 기준을 반영하는 평가 기준이 필요하다.
  • 기존 평가 기준의 한계를 극복하기 위해 중국 의료 자격시험, 정규 전문의 교육 시험, 책임의사 자격시험과 같은 다양한 진짜 출처를 포함한다.
  • 전자 건강 기록에서 유래한 실제 임상 사례를 통합하여 교과서 지식을 넘어서는 실질적 진단 추론 능력을 평가한다.
  • 항목 반응 이론을 활용한 심리측정적 검증을 통해 신뢰성 있고 확장 가능한 모델 평가를 보장하는 기준을 제공한다.
  • 중국어 전용 및 일반 도메인 LLM의 임상 지식 암기, 추론 능력, 설명 생성 능력에서의 강점과 약점을 규명한다.

제안 방법

  • 중국 의료 자격시험, 전문의 표준화 교육 시험, 책임의사 자격시험, 실제 임상 사례에서 유래한 총 40,041개 질문을 바탕으로 MedBench를 구축하였다.
  • 내과, 외과, 산부인과, 소아과의 네 가지 의료 분야로 나누고, 수준 1에서 수준 9까지의 계층적 난이도 척도를 적용하였다.
  • 단일 힙, 진술 식별, 다단계 추론과 같은 다양한 추론 유형을 통합하여 논리적 및 진단 추론 능력을 평가하였다.
  • 모델의 답변에 대한 설명을 수집하여 추론 과정의 일관성과 정확도를 평가하였다.
  • 항목 반응 이론(IRT)을 적용하여 질문 난이도와 모델 성능를 모델링함으로써 더 신뢰성 있고 확장 가능한 평가를 가능하게 하였다.
  • 모델 출력의 정당성을 검증하고 대화 품질 및 임상 추론 정확도를 평가하기 위해 인간 평가를 실시하였다.
Figure 1: Comparison of procedures in different countries.
Figure 1: Comparison of procedures in different countries.

실험 결과

연구 질문

  • RQ1중국 본토에서 의사가 겪는 교육 및 임상 전 과정을 반영하는 종합적 평가 기준에서 중국어 의료 LLM은 어떤 성능을 보이는가?
  • RQ2ChatGPT와 같은 일반 도메인 LLM은 중국어 환경에서 도메인 전용 모델에 비해 얼마나 의료 지식을 이식할 수 있는가?
  • RQ3LLM은 자신의 답변에 대해 논리적인 설명을 얼마나 잘 생성할 수 있으며, 설명의 품질은 답변 정확도와 관련이 있는가?
  • RQ4현재 중국어 의료 LLM에서 진단 추론 및 임상 지식 암기의 주요 한계는 무엇인가?
  • RQ5항목 반응 이론과 같은 심리측정 기법은 의료 LLM 평가의 신뢰성과 확장성을 향상시킬 수 있는가?

주요 결과

  • 중국어 의료 LLM은 MedBench에서 상당한 성능 부족을 보이며, 임상 지식과 진단 정확도 향상에 여전히 큰 개선 여지가 있음을 시사한다.
  • ChatGPT를 포함한 몇몇 일반 도메인 LLM은 강력한 의료 지식과 추론 능력을 보이며, 일반 도메인에서 의료 도메인으로의 지식 이식 가능성을 시사한다.
  • 인간 평가 결과, ChatGPT는 풍부한 임상 지식을 보이지만, 현재 중국어 의료 LLM은 고급 대화 능력과 충분한 사실 정확도를 확보하지 못하고 있다.
  • LLM은 잘못된 답변을 제시할 경우 종종 논리적이지 않은 설명을 생성하며, 이는 지식 격차 또는 잘못된 추론 메커니즘을 반영한다.
  • ChatGPT가 복잡한 임상 사례 분석 문제에서 빈약한 성능을 보이는 것은 깊은 의료 이해력과 임상 추론 능력의 심각한 결핍을 드러낸다.
  • 항목 반응 이론을 평가 기준에 통합함으로써 더 신뢰성 있고 확장 가능한 모델 평가가 가능해졌으며, 향후 평가 방법의 정교화를 지원한다.
Figure 2: Examples of prompts and corresponding answers. The left side shows the prompt and responses of LLMs on an example question from an exam. The right side is an example of a real-world case.
Figure 2: Examples of prompts and corresponding answers. The left side shows the prompt and responses of LLMs on an example question from an exam. The right side is an example of a real-world case.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.