Skip to main content
QUICK REVIEW

[论文解读] Extracting Adverse Drug Events from Clinical Notes

Darshini Mahendran, Bridget T. McInnes|PubMed|Apr 21, 2021
Topic Modeling参考文献 18被引用 10
一句话总结

本文提出了一项针对从临床笔记中提取不良药物反应(ADE)关系的基于规则、基于深度学习以及基于上下文语言模型方法的比较研究。使用 n2c2-2018 ADE 数据集,基于 BioBERT 的上下文模型取得了最先进的性能,F1 得分为 0.94,尽管基于规则的方法在特定关系类型(如 Strength-Drug 和 Form-Drug)上表现更优,原因在于其有效利用了共现模式。

ABSTRACT

Adverse drug events (ADEs) are unexpected incidents caused by the administration of a drug or medication. To identify and extract these events, we require information about not just the drug itself but attributes describing the drug (e.g., strength, dosage), the reason why the drug was initially prescribed, and any adverse reaction to the drug. This paper explores the relationship between a drug and its associated attributes using relation extraction techniques. We explore three approaches: a rule-based approach, a deep learning-based approach, and a contextualized language model-based approach. We evaluate our system on the n2c2-2018 ADE extraction dataset. Our experimental results demonstrate that the contextualized language model-based approach outperformed other models overall and obtain the state-of-the-art performance in ADE extraction with a Precision of 0.93, Recall of 0.96, and an F<sub>1</sub> score of 0.94; however, for certain relation types, the rule-based approach obtained a higher Precision and Recall than either learning approach.

研究动机与目标

  • 为解决从非结构化临床笔记中自动提取不良药物反应(ADE)的挑战,这在患者安全和成本降低方面至关重要。
  • 探究不同关系抽取(RE)技术——基于规则、深度学习和上下文语言模型——在识别药物-ADE 关系方面的有效性。
  • 比较各类关系类型的表现,特别是剂量、强度、给药途径和不良反应等属性。
  • 识别尽管结构简单,基于规则的系统仍优于学习型模型的场景。
  • 为未来在临床 NLP 中的多类别和联合实体-关系建模提供基础。

提出的方法

  • 基于规则的方法利用药物和属性实体之间的共现模式(例如,'500mg' 出现在 'aspirin' 附近)来推断关系,无需学习。
  • 深度学习模型使用卷积神经网络(CNNs)对句子级表示中的药物与属性对之间的关系进行分类。
  • 基于上下文语言模型的方法采用 BioBERT 对包含药物实体对的完整句子进行编码,以捕捉语义上下文用于关系分类。
  • 每种关系类型(如 Strength-Drug、ADE-Drug)均使用独立的二分类器进行建模,以提升泛化能力并避免类别不平衡。
  • 模型在 n2c2-2018 ADE 抽取数据集上进行微调,该数据集包含 1,000 份标注的临床笔记,共 11,000 个关系实例。
  • 性能通过标准 NLP 指标进行评估:精确率、召回率和 F1 得分,并进行各类关系类型及整体分析。

实验结果

研究问题

  • RQ1基于规则、深度学习和上下文语言模型方法在从临床笔记中提取 ADE 相关关系方面如何比较?
  • RQ2在哪些关系类型上,基于规则的方法优于学习型模型,原因是什么?
  • RQ3上下文语言模型(如 BioBERT)是否能在 n2c2-2018 基准上实现 ADE 关系抽取的最先进性能?
  • RQ4位置和语义表示如何影响临床文本中存在多个药物-实体对时的关系分类?
  • RQ5模型架构选择(如二分类与多分类分类)在低资源关系类型上的性能影响有多大?

主要发现

  • 基于 BioBERT 的上下文语言模型在整体上取得了最高的 F1 得分 0.94,精确率为 0.93,召回率为 0.96,确立了在 n2c2-2018 数据集上的最先进性能。
  • 对于 ADE-Drug 关系类型,基于规则的模型取得了 0.88 的精确率和 0.90 的召回率,其 F1 得分虽低于 BioBERT 模型的 0.97 和 0.97,但在精确率和召回率上表现更优。
  • 基于规则的方法在 Form-Drug 关系上取得了最高的 F1 得分 0.95,优于 BioBERT 模型的 0.94,表明其在稳定共现模式上表现强劲。
  • BioBERT 模型在 8 种关系类型中的 6 种上取得了最高 F1 得分,包括 Strength-Drug(0.94)、Duration-Drug(0.93)和 Frequency-Drug(0.94)。
  • UTH 团队的联合 biLSTM+CRF 模型取得了更高的 F1 得分 0.96,但 BioBERT 模型的召回率(0.96)高于除一个团队外的所有团队,表明其在 ADE 检测上具有更好的敏感性。
  • 研究发现,将实体替换为语义类型(如 Wei 等人所述)会导致性能低于使用原始实体跨度,表明保留实体身份有助于提升关系建模性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。