[论文解读] AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark Dataset
AfriMed-QA 引入了一个大规模、泛非洲、多专科的医学问答基准,涵盖来自16个国家的32个专科的15,275道问题,包括选择题、简答题和消费者查询。对30种大语言模型(LLM)的评估显示,其性能在不同专科和地理区域间存在显著差异,生物医学模型在表现上落后于通用模型,且尽管存在幻觉和遗漏,消费者仍更偏好 LLM 的解释而非临床医生的回答。
Recent advancements in large language model(LLM) performance on medical multiple choice question (MCQ) benchmarks have stimulated interest from healthcare providers and patients globally. Particularly in low-and middle-income countries (LMICs) facing acute physician shortages and lack of specialists, LLMs offer a potentially scalable pathway to enhance healthcare access and reduce costs. However, their effectiveness in the Global South, especially across the African continent, remains to be established. In this work, we introduce AfriMed-QA, the first large scale Pan-African English multi-specialty medical Question-Answering (QA) dataset, 15,000 questions (open and closed-ended) sourced from over 60 medical schools across 16 countries, covering 32 medical specialties. We further evaluate 30 LLMs across multiple axes including correctness and demographic bias. Our findings show significant performance variation across specialties and geographies, MCQ performance clearly lags USMLE (MedQA). We find that biomedical LLMs underperform general models and smaller edge-friendly LLMs struggle to achieve a passing score. Interestingly, human evaluations show a consistent consumer preference for LLM answers and explanations when compared with clinician answers.
研究动机与目标
- 为解决低收入和中等收入国家(LMICs),特别是非洲地区,代表性医学大语言模型基准的缺乏问题。
- 创建一个多样化、大规模的医学问答数据集,反映非洲大陆的区域医学知识、语言多样性以及临床背景。
- 从多个维度评估30种大语言模型的性能与公平性,包括正确性、人口统计偏见和人类偏好。
- 评估大语言模型是否能在现实医学场景中,特别是在代表性不足的地区,达到或超越临床医生的推理水平。
- 为开发公平、具有区域相关性的全球健康人工智能工具奠定基础,特别是在医生资源短缺的环境中。
提出的方法
- 从16个非洲国家的60多所医学院收集了15,275道医学问题,涵盖32个专科。
- 将问题分类为三类:选择题(MCQs)、简答题(SAQs)和消费者查询(CQs),并附有专家标注的答案和推理过程。
- 通过临床医生盲评方式,使用1,430道选择题评估30种大语言模型在正确性、幻觉、遗漏和危害检测方面的表现。
- 通过临床医生开展人类评估,对模型生成的回答在正确性、幻觉、遗漏和潜在危害方面进行评分。
- 采用多维评估框架,评估不同专科、地理区域和模型类型(生物医学模型与通用模型、开源与闭源模型)之间的性能差异。
- 应用统计分析比较模型表现,并识别在偏见、正确性和偏好方面模型与专科之间的模式。
实验结果
研究问题
- RQ1与 MedQA 和 USMLE 等既定基准相比,大语言模型在泛非洲、多专科医学问答基准 AfriMed-QA 上的表现如何?
- RQ2在非洲的医学专科和地理区域之间,性能差异的程度如何?
- RQ3在非洲医学背景下,生物医学专用大语言模型是否在临床推理任务中优于通用大语言模型?
- RQ4与临床医生的回答相比,大语言模型生成的答案在多大程度上包含幻觉、遗漏或有害内容?
- RQ5即使存在错误,消费者是否仍更偏好大语言模型的解释而非临床医生的回答?
主要发现
- 大语言模型在 AfriMed-QA 上的表现因专科而异,表现最低的是妇产科(平均正确率 4.62/5),最高的是医学遗传学(5.00/5)。
- 生物医学大语言模型(如 Med-PaLM2 和 MedLM)在表现上落后于通用大语言模型(如 GPT-4 和 Llama3-70B),后者在正确性上表现更高且幻觉率更低。
- 较小的、适合边缘设备部署的大语言模型(如 Phi-3-mini 和 Mistral-7B)在选择题中未能达到及格分数,表明其在低资源环境下的推理能力存在局限。
- 尽管错误率较高,人类评估者仍一致更偏好大语言模型生成的解释,尤其是在清晰度和完整性方面。
- 临床医生评估发现,大语言模型在眼科领域有 11.36% 的回答遗漏了相关信息,在肺科领域有 10.64% 的回答存在遗漏,相应幻觉率分别为 8.70% 和 7.59%。
- 在非洲本地专业知识方面,模型 Mixtral-8x7B-Instruct-v0.1 的遗漏率最高(11.11%),而 Llama3-OpenBioLLM-70B 在该类别中的危害率最高(28.57%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。