Skip to main content
QUICK REVIEW

[论文解读] EHRXQA: A Multi-Modal Question Answering Dataset for Electronic Health Records with Chest X-ray Images

Seongsu Bae, Daeun Kyung|arXiv (Cornell University)|Oct 28, 2023
Multimodal Machine Learning Applications被引用 7
一句话总结

本文提出了EHRXQA,这是首个将结构化电子健康记录(EHR)与胸部X光片相结合的多模态问答数据集,支持在表格与影像模态之间进行联合推理。该研究提出了一种基于NeuralSQL的框架,将大语言模型与外部VQA API相结合,实现了在图像+表格多模态问题上的78.3%精确匹配准确率,显著推动了多模态EHR问答的发展。

ABSTRACT

Electronic Health Records (EHRs), which contain patients' medical histories in various multi-modal formats, often overlook the potential for joint reasoning across imaging and table modalities underexplored in current EHR Question Answering (QA) systems. In this paper, we introduce EHRXQA, a novel multi-modal question answering dataset combining structured EHRs and chest X-ray images. To develop our dataset, we first construct two uni-modal resources: 1) The MIMIC-CXR-VQA dataset, our newly created medical visual question answering (VQA) benchmark, specifically designed to augment the imaging modality in EHR QA, and 2) EHRSQL (MIMIC-IV), a refashioned version of a previously established table-based EHR QA dataset. By integrating these two uni-modal resources, we successfully construct a multi-modal EHR QA dataset that necessitates both uni-modal and cross-modal reasoning. To address the unique challenges of multi-modal questions within EHRs, we propose a NeuralSQL-based strategy equipped with an external VQA API. This pioneering endeavor enhances engagement with multi-modal EHR sources and we believe that our dataset can catalyze advances in real-world medical scenarios such as clinical decision-making and research. EHRXQA is available at https://github.com/baeseongsu/ehrxqa.

研究动机与目标

  • 为解决缺乏公开可用的整合结构化表格与医学影像的多模态EHR问答数据集的问题。
  • 弥合当前EHR问答系统仅关注单一模态、忽视影像与表格数据联合推理的差距。
  • 构建一个基准数据集,支持真实临床决策中的一元模态与跨模态问答。
  • 实现能够理解涉及EHR表格与胸部X光片的复杂、多维度临床问题的先进问答系统。
  • 通过提供大规模、多样化且具有临床相关性的数据集,为推进多模态医疗AI奠定基础。

提出的方法

  • 构建MIMIC-CXR-VQA,一个源自MIMIC-CXR的新医学视觉问答基准,用于支持EHR中的基于图像的问答。
  • 将基于MIMIC-IV的EHRSQL重构为面向表格问答的结构化EHR问答资源。
  • 整合MIMIC-CXR-VQA与EHRSQL,创建EHRXQA,一个包含三种问答范围的多模态数据集:仅图像、仅表格、以及图像+表格的跨模态问题。
  • 提出一种基于NeuralSQL的架构,通过引入新的FUNC_VQA()语法扩展SQL,以调用外部VQA API实现图像推理。
  • 采用少样本 few-shot 示例(10-shot)的上下文学习方法,使用ChatGPT作为解析器,M³AE预训练模型作为冻结的VQA API。
  • 应用两种提示策略:固定少样本示例与基于BM25的检索相关训练示例,以提升泛化能力。

实验结果

研究问题

  • RQ1多模态EHR问答系统能否有效结合结构化EHR表格与胸部X光片,以回答复杂的临床问题?
  • RQ2多模态问答系统的性能在不同类型的问答中如何变化——仅图像、仅表格,或图像+表格的跨模态查询?
  • RQ3与单模态基线相比,大语言模型结合外部VQA API在多模态EHR数据上的推理能力能提升多少?
  • RQ4与固定少样本提示相比,通过BM25检索相关少样本示例是否能提高多模态问答的准确率?
  • RQ5问题的多样性与复杂性对多模态EHR问答系统性能有何影响?

主要发现

  • 采用BM25提示策略的所提出的NeuralSQL方法在图像+表格跨模态问题上实现了78.3%的精确匹配准确率,表明其在复杂多模态推理任务中表现优异。
  • 在仅图像的问题上,模型在单张图像查询中达到94.4%的准确率,表明其在单模态图像推理方面表现强劲。
  • 在仅表格的问题上,模型在“none”患者范围下达到98.0%的准确率,显示出对结构化EHR数据的高可靠性。
  • 固定提示策略在跨模态问题上表现欠佳,单张图像+表格查询的精确匹配准确率仅为3.3%,凸显动态少样本检索的重要性。
  • 在群体级患者查询中性能显著下降(例如,图像+表格群体查询准确率为15.0%),表明在聚合患者数据上推理仍具挑战。
  • 基于BM25的检索策略在所有模态中均优于固定少样本方法,尤其在复杂与多样化问题上表现更优,证明其在上下文选择中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。