Skip to main content
QUICK REVIEW

[论文解读] Pattern Recognition or Medical Knowledge? The Problem with Multiple-Choice Questions in Medicine

Maxime Griot, Jean Vanderdonckt|arXiv (Cornell University)|Jun 4, 2024
Expert finding and Q&A systems被引用 4
一句话总结

本研究通过基于虚构医学腺体Glianorex的多项选择题(MCQ)评估大型语言模型(LLMs),以将模式识别与真正的临床知识区分开来。尽管模型此前未接触过相关内容,LLMs在各类模型中均达到了约67%的准确率,表明MCQ主要测试统计模式匹配而非深层理解,从而对当前评估AI医学推理能力基准的有效性提出质疑。

ABSTRACT

Large Language Models (LLMs) such as ChatGPT demonstrate significant potential in the medical domain and are often evaluated using multiple-choice questions (MCQs) modeled on exams like the USMLE. However, such benchmarks may overestimate true clinical understanding by rewarding pattern recognition and test-taking heuristics. To investigate this, we created a fictional medical benchmark centered on an imaginary organ, the Glianorex, allowing us to separate memorized knowledge from reasoning ability. We generated textbooks and MCQs in English and French using leading LLMs, then evaluated proprietary, open-source, and domain-specific models in a zero-shot setting. Despite the fictional content, models achieved an average score of 64%, while physicians scored only 27%. Fine-tuned medical models outperformed base models in English but not in French. Ablation and interpretability analyses revealed that models frequently relied on shallow cues, test-taking strategies, and hallucinated reasoning to identify the correct choice. These results suggest that standard MCQ-based evaluations may not effectively measure clinical reasoning and highlight the need for more robust, clinically meaningful assessment methods for LLMs.

研究动机与目标

  • 调查多项选择题(MCQ)基准是否真正评估大型语言模型(LLMs)的临床知识与推理能力,还是仅测试模式识别。
  • 评估不同LLMs——包括开源模型、专有模型及微调模型——在无现实世界接触的虚构医学领域中的表现。
  • 确定模型规模、架构或领域特定微调是否能提升LLMs在评估不存在医学知识的MCQ中的表现。
  • 质疑现有基于MCQ的基准在评估LLMs真实临床理解能力方面的有效性。
  • 倡导采用超越MCQ的更稳健评估方法,以更好地评估LLMs的临床推理与知识。

提出的方法

  • 创建了一个虚构的医学腺体Glianorex,并使用GPT-4以英语和法语生成了关于该腺体的综合性教科书。
  • 基于虚构教科书,每种语言生成了264道多项选择题,确保不包含任何真实医学内容。
  • 在零样本设置下,未对虚构数据进行微调,评估了多样化的LLMs——包括开源模型、专有模型及微调医学模型。
  • 采用高温度采样,并对每段文字生成多轮问题,以减少问题生成过程中产生的合成偏差。
  • 在英语和法语中测量性能,以评估语言依赖性模式识别的影响。
  • 进行统计分析,评估不同模型和语言之间性能差异的显著性。

实验结果

研究问题

  • RQ1LLMs在完全虚构的医学知识基础上的MCQ中达到高分的程度如何,这是否表明其依赖的是模式识别而非真正理解?
  • RQ2与较小或基础模型相比,更大或微调后的LLMs在虚构MCQ上的表现是否显著更优?
  • RQ3同一组MCQ的英语版本与法语版本之间是否存在可测量的性能差异,这是否暗示了语言特定的模式利用?
  • RQ4基于MCQ的基准是否能有效区分LLMs的表面应试策略与深层临床推理?
  • RQ5LLMs在虚构MCQ中表现优异,是否可能削弱当前基准在评估真实医学知识方面有效性的可信度?

主要发现

  • LLMs在基于虚构医学腺体Glianorex的多项选择题中,平均准确率约为67%,尽管模型此前未接触过相关内容。
  • 不同规模、架构和专业化的模型之间性能几乎完全相同,表明其表现主要依赖于模式识别而非深层知识。
  • 英语版本的性能略高于法语版本,表明语言特定的统计模式可能影响结果。
  • 微调医学模型在英语中相比基础模型有微弱提升,但在法语中未见类似增益,进一步凸显语言和模式匹配的作用。
  • 各类模型在性能上的一致性表明,MCQ主要评估应试策略和统计模式匹配,而非临床理解。
  • 本研究得出结论:当前基于MCQ的基准可能无法有效衡量LLMs的真实临床知识或推理能力,亟需更稳健的评估方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。