[论文解读] emrQA: A Large Corpus for Question Answering on Electronic Medical Records
本文提出 emrQA,一个大规模、面向患者的电子病历(EMR)问答数据集,通过复用现有的 i2b2 临床 NLP 标注生成。该框架利用专家标注的实体与关系,自动生成 400,000 个问答对以及 100 万个问题-逻辑形式对,支持复杂推理任务(如时间推理和算术推理)的可解释性、临床基础问答模型的训练。
We propose a novel methodology to generate domain-specific large-scale question answering (QA) datasets by re-purposing existing annotations for other NLP tasks. We demonstrate an instance of this methodology in generating a large-scale QA dataset for electronic medical records by leveraging existing expert annotations on clinical notes for various NLP tasks from the community shared i2b2 datasets. The resulting corpus (emrQA) has 1 million question-logical form and 400,000+ question-answer evidence pairs. We characterize the dataset and explore its learning potential by training baseline models for question to logical form and question to answer mapping.
研究动机与目标
- 解决临床 NLP 研究中缺乏大规模、公开可用的 EMR 问答数据集的问题。
- 开发一种可扩展、低专家参与度的框架,利用现有 NLP 标注生成领域特定的问答数据集。
- 创建一个能够捕捉临床叙述复杂性的数据集,包括纵向记录、时间推理和医学术语。
- 通过将问题与答案关联的符号化逻辑形式,支持可解释问答模型的开发。
- 支持在开放域数据集未涵盖的挑战性推理任务(如算术推理和时间推理)上进行模型基准测试。
提出的方法
- 复用临床笔记中已有的 i2b2 标注——如命名实体和关系——以生成问答对与逻辑形式。
- 采用逆向工程方法:基于标注的实体-关系对定义问题模板与逻辑形式模板。
- 将每个标注的实体-关系对映射为自然语言问题以及表示语义结构的符号化逻辑形式。
- 从原始临床文本中提取答案片段,确保与问题和逻辑形式保持一致。
- 将该框架应用于 i2b2 数据集中 1,000 余例患者记录,生成 100 万个问题-逻辑形式对与 400,000 个问答对。
- 通过组合模板并引入词汇变化或指代消解,增强复杂性,扩展数据集的推理挑战。
实验结果
研究问题
- RQ1能否系统性地复用现有临床 NLP 标注,以极低的专家投入生成大规模、高质量的 EMR 问答数据集?
- RQ2emrQA 中问题的复杂性与开放域问答数据集(如 SQuAD)相比如何,特别是在推理能力与语言变体方面?
- RQ3逻辑形式在多大程度上提升了临床问答模型的可解释性与性能?
- RQ4在真实的 EMR 问答任务中,哪些推理类型(如时间推理或算术推理)会出现,以及如何在数据集中加以捕捉?
- RQ5所提出的框架能否推广至其他标注资源有限但已有 NLP 标注的领域?
主要发现
- emrQA 数据集包含 400,000 个问答对与 100 万个问题-逻辑形式对,是目前公开可用的最大规模患者特定 EMR 问答语料库。
- 问答对与问题到逻辑形式映射的基线模型在多关系问题上表现较差,表明该数据集准确捕捉了复杂推理需求。
- 错误分析显示,38% 的预测失败涉及多句推理,其中 16% 是由于多证据问题中缺少证据。
- 句法变体(14%)与医学推理(10%)是主要挑战,且 14% 的错误源于 DrQA 预测的证据片段不完整。
- 该数据集引入了开放域基准(如 SQuAD)中不存在的新推理挑战——算术推理与时间推理,显著提升了其临床相关性。
- 该框架具有可扩展性,可应用于其他领域(如基于 Wikipedia 的问答),利用 DBPedia 等现有知识库生成无需众包的合成问答对。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。