Skip to main content
QUICK REVIEW

[论文解读] Toward Understanding Clinical Context of Medication Change Events in Clinical Narratives

Diwakar Mahajan, Jennifer J. Liang|PubMed|Nov 17, 2020
Machine Learning in Healthcare参考文献 26被引用 15
一句话总结

本文介绍了上下文化药物事件数据集(CMED),该数据集包含9,013个药物变更事件,涵盖四个正交维度:动作(Action)、时间性(Temporality)、确定性(Certainty)和行为者(Actor)。通过一种新颖的概念框架,CMED为药物重整和时间线生成等临床应用提供了更优的上下文理解。使用特征工程的SVM模型进行基线实验,事件分类的F1分数最高达0.88,行为者预测的F1分数最高达0.96。

ABSTRACT

Understanding medication events in clinical narratives is essential to achieving a complete picture of a patient's medication history. While prior research has explored identification of medication changes in clinical notes, due to the longitudinal and narrative nature of clinical documentation, extraction of medication change alone without the necessary clinical context is insufficient for use in real-world applications, such as medication timeline generation and medication reconciliation. Here, we present a framework to capture multi-dimensional context of medication changes documented in clinical notes. We define specific contextual aspects pertinent to medication change events (i.e. Action, Negation, Temporality, Certainty, and Actor), describe the annotation process and challenges encountered while creating the dataset, and explore models based on state-of-the-art transformers to automate the task. The resulting dataset, Contextualized Medication Event Dataset (CMED), consisting of 9,013 medications annotated over 500 clinical notes, will be released to the community as a shared task in 2021-2022.

研究动机与目标

  • 为解决先前药物事件分类研究中临床上下文不全面的问题,特别是针对药物重整和时间线生成等实际应用场景。
  • 开发一种结构化、多维框架,以捕捉非结构化临床叙述中药物变更事件的完整临床上下文。
  • 创建并发布一个高质量、面向社区的数据集(CMED),以支持共享任务并推动临床NLP研究的发展。
  • 通过使用多样化语言和上下文特征的基线实验,证明上下文化药物事件分类的可行性。

提出的方法

  • 作者开发了一个概念框架,将药物变更的上下文组织为四个正交维度:动作(例如,开始、停止、增加)、时间性(过去、现在、未来)、确定性(确定、假设性、条件性)和行为者(医生、患者)。
  • 由一名医生领导的三名标注员对i2b2/UTHealth 2014年NLP共享任务中的500份临床笔记进行了标注,其中120份用于计算组间一致性(Cohen’s kappa)。
  • 该数据集CMED包含500份笔记中的9,013个药物提及,其中7,230个用于训练集,1,783个用于测试集,于2021年作为共享任务发布。
  • 采用五步分类流程:(1) 将每个提及分类为处置(Disposition)、无处置(NoDisposition)或未确定(Undetermined);(2)–(5) 沿四个上下文维度对处置事件进行分类。
  • 使用线性核的基于特征的SVM模型进行训练,特征类别包括六类:n-gram、词法句法(词性标注、词干)、窗口特征、依存句法解析、笔记部分(note-section)和RxNorm标识符。
  • 通过调整类别权重来处理类别不平衡问题,并对特征进行消融实验,以评估其对每个分类子任务的影响。

实验结果

研究问题

  • RQ1如何在简单分类之外,系统性地对临床叙述中的药物变更事件进行上下文化处理?
  • RQ2哪些特征对预测药物事件的动作、时间性、确定性和行为者维度最具信息量?
  • RQ3药物提及在临床笔记中的位置(例如,主诉(HPI)与既往史(PMH))在多大程度上能提升时间性和行为者分类的性能?
  • RQ4包含RxNorm标识符和依存句法解析在多大程度上能增强药物事件上下文的建模能力?
  • RQ5机器学习模型在这一多维、多分类任务上的基线性能如何?

主要发现

  • 基线SVM模型在事件分类任务(处置 vs. 无处置 vs. 未确定)中F1分数达到0.88,其中笔记部分和窗口特征的影响最为显著。
  • 在行为者分类子任务中,模型F1分数达到0.96,表明在识别是医生还是患者发起药物变更方面表现优异。
  • 时间性维度的F1分数为0.85,笔记部分特征通过利用部分上下文(如HPI与PMH)显著提升了性能。
  • 确定性维度的F1分数最高,达到0.92,表明与可能性相关的语言线索(如“如果”、“可能”)对确定性水平具有高度预测性。
  • 动作维度的F1分数为0.67,窗口特征和词法句法特征在区分增加、减少及其他变更方面最为有效。
  • 特征消融分析表明,不同特征类型对各维度的影响各异,表明需要采用针对不同维度的特征选择策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。