[논문 리뷰] MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
MedXpertQA는 텍스트 및 다중모달 하위집합으로 전문 인력 수준의 의학적 추론을 평가하고, 18개의 모델을 테스트하며 o1형 모델을 위한 추론 중심 하위집합을 도입하는 매우 도전적인 의학 벤치마크를 제시합니다.
We introduce MedXpertQA, a highly challenging and comprehensive benchmark to evaluate expert-level medical knowledge and advanced reasoning. MedXpertQA includes 4,460 questions spanning 17 specialties and 11 body systems. It includes two subsets, Text for text evaluation and MM for multimodal evaluation. Notably, MM introduces expert-level exam questions with diverse images and rich clinical information, including patient records and examination results, setting it apart from traditional medical multimodal benchmarks with simple QA pairs generated from image captions. MedXpertQA applies rigorous filtering and augmentation to address the insufficient difficulty of existing benchmarks like MedQA, and incorporates specialty board questions to improve clinical relevance and comprehensiveness. We perform data synthesis to mitigate data leakage risk and conduct multiple rounds of expert reviews to ensure accuracy and reliability. We evaluate 18 leading models on \benchmark. Moreover, medicine is deeply connected to real-world decision-making, providing a rich and representative setting for assessing reasoning abilities beyond mathematics and code. To this end, we develop a reasoning-oriented subset to facilitate the assessment of o1-like models. Code and data are available at: https://github.com/TsinghuaC3I/MedXpertQA
연구 동기 및 목표
- 다양한 전문 분야와 체계에 걸친 전문 수준의 의학 지식과 추론을 평가합니다.
- 실제 임상 작업을 반영하기 위해 텍스트 전용 평가와 다중모달 평가를 모두 제공합니다.
- 필터링, 확장, 전문가 리뷰를 통해 기존 벤치마크보다 난이도와 현실성을 높입니다.
- 기본 지식이나 지각을 넘어서는 고급 의학적 추론 능력의 분석을 가능하게 합니다.
제안 방법
- USMLE, COMLEX-USA, 전문의 시험, NEJM Image Challenges와 같은 이미지가 풍부한 출처에서 방대한 질문 은행을 큐레이션합니다.
- Brier 점수와 전문가 표를 사용하여 계층적 난이도 기반 및 전문가 필터링을 적용해 도전적인 질문을 선별합니다.
- 다양성과 난이도를 높이면서 데이터 누설을 완화하기 위해 LLM으로 질문과 선택지를 보강합니다.
- 정확성과 신뢰성을 보장하기 위해 데이터 합성 및 다중 라운드의 전문가 리뷰를 도입합니다.
- 주요 의학 과제(Diagnosis, Treatment Planning, Basic Medicine)와 세부 하위 작업을 GPT-4o 프롬프트를 사용하여 질문에 주석 처리합니다.
- 제공된 Reasoning 및 Understanding 하위집합을 포함한 전문 분석을 위해 0-shot CoT 프롬프트에서 18개 대형 모델(LMMs 및 LLMs)을 평가합니다.
실험 결과
연구 질문
- RQ1다양한 전문 분야와 체계에 걸친 전문가 수준의 의학적 추론에서 최첨단 LMM/LLMs의 역량은 어느 수준인가요?
- RQ2MedXpertQA와 같은 벤치마크가 사실적 의학 지식을 넘어서는 추론을, 다중모달 작업을 포함하여 신뢰성 있게 평가할 수 있을까요?
- RQ3추론이 집중된 의학적 질문에서 현재 모델과 전문가 인간 기준 간의 성능 격차는 어느 정도인가요?
- RQ4추론 시간 확장이 도전적 작업에서 의학적 추론 성능에 어떤 영향을 미치나요?
- RQ5Reasoning-에 초점을 맞춘 하위집합이 의학에서 o1형 추론 모델을 효과적으로 구분할 수 있나요?
주요 결과
- MedXpertQA는 매우 도전적이며, 현재 모델은 복잡한 의학적 추론 과제에서 한정된 성능을 보입니다.
- GPT-4o는 일반적으로 기본 LMM들 중 MedXpertQA에서 최고 성능을 보이며, GPT-4o-mini 및 다른 모델이 그 뒤를 잇습니다; Qwen-시리즈와 오픈 모델은 다중모달 설정에서 차이가 납니다.
- DeepSeek-R1은 특히 Reasoning 하위집합에서 강한 추론 성능을 보이며, 의학적 추론 능력의 전문적인 평가 필요성을 강조합니다.
- Reasoning 하위집합은 Understanding보다 안정적으로 더 도전적이며, o1-like 모델의 추론 능력 차이를 효과적으로 구분하고 있음을 시사합니다.
- 데이터 보강과 다중 라운드 전문가 리뷰는 누수 위험을 줄이고 핵심 임상 내용을 손상시키지 않으면서 데이터 세트의 품질을 향상시킵니다.
- MedXpertQA MM은 더 높은 복잡성과 더 풍부한 이미지를 보여주고, MedXpertQA Text는 11개 체계에 걸친 전문 분야 주도 평가를 강조합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.