[论文解读] Multimodal Clinical Benchmark for Emergency Care (MC-BEC): A Comprehensive Benchmark for Evaluating Foundation Models in Emergency Medicine
本文提出了MC-BEC,一个用于评估急诊医学中基础模型的综合性多模态基准,基于102,731例急诊科就诊记录,涵盖多种数据类型,包括生命体征、心电图/光电容积脉搏波形、放射科报告和结构化电子健康记录。该基准支持在多个时间尺度上对临床相关任务——失代偿、处置和再就诊预测——进行稳健评估,提供基线模型、标准化划分和公平性评估,展示了模型在缺失模态情况下的鲁棒性,并揭示了性能在不同人口统计群体中的差异。
We propose the Multimodal Clinical Benchmark for Emergency Care (MC-BEC), a comprehensive benchmark for evaluating foundation models in Emergency Medicine using a dataset of 100K+ continuously monitored Emergency Department visits from 2020-2022. MC-BEC focuses on clinically relevant prediction tasks at timescales from minutes to days, including predicting patient decompensation, disposition, and emergency department (ED) revisit, and includes a standardized evaluation framework with train-test splits and evaluation metrics. The multimodal dataset includes a wide range of detailed clinical data, including triage information, prior diagnoses and medications, continuously measured vital signs, electrocardiogram and photoplethysmograph waveforms, orders placed and medications administered throughout the visit, free-text reports of imaging studies, and information on ED diagnosis, disposition, and subsequent revisits. We provide performance baselines for each prediction task to enable the evaluation of multimodal, multitask models. We believe that MC-BEC will encourage researchers to develop more effective, generalizable, and accessible foundation models for multimodal clinical data.
研究动机与目标
- 为解决急诊医学中缺乏全面、多模态基准以评估基础模型的问题。
- 构建一个标准化评估框架,包含训练-测试划分和指标,用于在多个时间尺度上评估临床相关预测任务。
- 实现在缺失数据条件下及不同人口统计群体中的模型性能稳健评估。
- 基于新冠疫情期间的丰富多模态数据集,为多任务和任务特定模型提供性能基线。
- 推动更可泛化、公平且具有临床可解释性的基础模型在真实急诊医疗场景中的发展。
提出的方法
- 该基准基于MC-MED-v0数据集构建,包含2020–2022年间102,731例急诊科就诊记录,涵盖连续生理监测和多模态临床数据。
- 数据集包含分诊信息、既往诊断与用药记录、医嘱、药物给药记录、检验结果、生命体征、心电图与光电容积脉搏波形,以及自由文本的放射科报告。
- 该基准定义了三项主要预测任务:患者失代偿(数分钟内)、处置(数小时内)和急诊科再就诊(数天内),每项任务均配有标准化评估指标和训练-测试划分。
- 采用多任务学习框架,实现在不同任务间的联合预测,同时通过消融研究评估模型对缺失模态的鲁棒性。
- 通过人口统计子群比较(年龄、性别、种族、民族)进行公平性评估,使用真阳性率(TPR)差异、统计独立性差异(SPD)、差异影响(DI)和相等机会差异(EOD)等指标。
- 采用基于LightGBM的基线模型,建立性能参考基准,强调在复杂多模态环境中显式数据特征工程的价值。
实验结果
研究问题
- RQ1基础模型在使用多模态急诊科数据时,对失代偿、处置和再就诊等临床相关预测任务的性能表现如何?
- RQ2模型预测对不同模态缺失数据的鲁棒性如何,特别是在更长预测窗口下?
- RQ3在不同人口统计子群(如种族、性别、年龄)中,模型预测性能是否存在差异?
- RQ4与任务特定建模相比,多任务学习在多模态急诊医疗数据上的性能和泛化能力如何?
- RQ5标准化基准在多大程度上能提升急诊医学中可泛化、公平且具有临床可解释性的基础模型的评估与开发?
主要发现
- 基准显示,对于失代偿预测,当连续监测数据缺失时,模型性能最敏感,AUPRC在较长时间窗口内最高下降0.14。
- 当医嘱数据缺失时,处置预测性能显著下降,表明临床工作流数据在护理规划中的关键作用。
- 在3天内急诊科再就诊预测中,不同种族群体之间的平均TPR差异最大达到0.11,表明模型性能存在显著的人口统计偏差。
- 在90分钟和120分钟的失代偿预测中观察到性别差异,TPR差异分别为0.08和0.09。
- 在60分钟失代偿预测中发现年龄相关差异,不同年龄组之间的TPR差异为0.07。
- 该基准揭示,对于短期预测,模型最易受生理监测数据缺失的影响;而对于长期处置预测,结构化数据(如医嘱)最为关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。