Skip to main content
QUICK REVIEW

[論文レビュー] MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding

Yuxin Zuo, Shang Qu|ArXiv.org|Jan 30, 2025
Biomedical Text Mining and Ontologies被引用数 3
ひとこと要約

MedXpertQA は、専門的レベルの医療推論を評価するテキストおよびマルチモーダルのサブセットを含む高度に難解な医療ベンチマークを提示し、18モデルを評価し、o1 に似たモデルの推論に焦点を当てたサブセットを導入します。

ABSTRACT

We introduce MedXpertQA, a highly challenging and comprehensive benchmark to evaluate expert-level medical knowledge and advanced reasoning. MedXpertQA includes 4,460 questions spanning 17 specialties and 11 body systems. It includes two subsets, Text for text evaluation and MM for multimodal evaluation. Notably, MM introduces expert-level exam questions with diverse images and rich clinical information, including patient records and examination results, setting it apart from traditional medical multimodal benchmarks with simple QA pairs generated from image captions. MedXpertQA applies rigorous filtering and augmentation to address the insufficient difficulty of existing benchmarks like MedQA, and incorporates specialty board questions to improve clinical relevance and comprehensiveness. We perform data synthesis to mitigate data leakage risk and conduct multiple rounds of expert reviews to ensure accuracy and reliability. We evaluate 18 leading models on \benchmark. Moreover, medicine is deeply connected to real-world decision-making, providing a rich and representative setting for assessing reasoning abilities beyond mathematics and code. To this end, we develop a reasoning-oriented subset to facilitate the assessment of o1-like models. Code and data are available at: https://github.com/TsinghuaC3I/MedXpertQA

研究の動機と目的

  • 多様な専門分野と体制領域にわたる専門家レベルの医療知識と推論を評価する。
  • 現実の臨床タスクを反映するために、テキストのみとマルチモーダルの評価の両方を提供する。
  • フィルタリング、拡張、専門家レビューを通じて、既存ベンチマークより難易度と現実感を高める。
  • 基本的な知識や知覚を超えた高度な医療推論能力の分析を可能にする。

提案手法

  • USMLE、COMLEX-USA、専門 board 試験、および NEJM Image Challenges のような画像豊富なソースから大規模な質問データベースを作成する。
  • Brier スコアと専門家投票を用いた階層的難易度ベースおよび専門家フィルタリングで、難易度の高い質問を選択する。
  • データ漏洩を抑制しつつ多様性と難易度を強化するために、LLMs を用いて質問と選択肢を拡張する。
  • 正確性と妥当性を確保するためにデータ合成と複数ラウンドの専門家レビューを導入する。
  • GPT-4o プロンプトを使用して、質問に核となる医療タスク(Diagnosis、Treatment Planning、Basic Medicine)および細かなサブタスクを注釈付けする。
  • 18 の大規模モデル(LMMs および LLMs)をゼロショット CoT プロンプティングで評価し、専門的分析のためのReasoning および Understanding のサブセットを用意する。

実験結果

リサーチクエスチョン

  • RQ1最新鋭の LMMs/LLMs は、多様な専門分野と体制領域における専門家レベルの医療推論でどの程度能力があるか。
  • RQ2MedXpertQA のようなベンチマークは、事実的な医療知識を超える推論を、マルチモーダルタスクを含めて信頼性をもって評価できるか。
  • RQ3現在のモデルと専門家の人間ベースラインとの推論集約型の医療問題におけるパフォーマンス差はどれくらいか。
  • RQ4推論時のスケーリングが難易度の高いタスクにおける医療推論パフォーマンスにどう影響するか。
  • RQ5Reasoning-focused サブセットは、医学における o1- 類似の推論モデルを効果的に区別できるか。

主な発見

  • MedXpertQA は極めて難しく、現行モデルは高度な医療推論タスクで限られた性能を示す。
  • GPT-4o はベースの LMMs の中で MedXpertQA で概ね最も良い性能を示し、GPT-4o-mini や他のモデルがそれに続く。Qwen 系列およびオープンモデルはマルチモーダル設定でばらつきがある。
  • DeepSeek-R1 は推論性能が高く、特に Reasoning サブセットで強力な推論能力を示し、医療推論能力の専門的評価の必要性を強調している。
  • Reasoning サブセットは Understanding よりも信頼的に難しく、o1-類似のモデルの推論能力を効果的に区別できることを示している。
  • データ拡張と複数ラウンドの専門家レビューはリークリスクを低減し、コア臨床内容を損なうことなくデータセットの品質を向上させる。
  • MedXpertQA MM はより高い複雑さと豊かな画像を示し、MedXpertQA Text は 11 の体制領域にわたる専門分野主導の評価を強調する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。