Skip to main content
QUICK REVIEW

[论文解读] Automated Detection of Adverse Drug Reactions in the Biomedical Literature Using Convolutional Neural Networks and Biomedical Word Embeddings

Diego Saldana Miranda|arXiv (Cornell University)|Apr 24, 2018
Pharmacovigilance and Adverse Drug Reactions被引用 8
一句话总结

本文提出了一种结合生物医学词嵌入的卷积神经网络(CNN)模型,用于在生物医学文献中自动检测与不良药物反应(ADR)相关的句子。基于ADE语料库,研究证明去重处理和生物医学词嵌入显著提升了分类性能,其中Huynh架构在所有指标上均优于先前模型,F1得分达到0.798,AUROC达到0.958。

ABSTRACT

Monitoring the biomedical literature for cases of Adverse Drug Reactions (ADRs) is a critically important and time consuming task in pharmacovigilance. The development of computer assisted approaches to aid this process in different forms has been the subject of many recent works. One particular area that has shown promise is the use of Deep Neural Networks, in particular, Convolutional Neural Networks (CNNs), for the detection of ADR relevant sentences. Using token-level convolutions and general purpose word embeddings, this architecture has shown good performance relative to more traditional models as well as Long Short Term Memory (LSTM) models. In this work, we evaluate and compare two different CNN architectures using the ADE corpus. In addition, we show that by de-duplicating the ADR relevant sentences, we can greatly reduce overoptimism in the classification results. Finally, we evaluate the use of word embeddings specifically developed for biomedical text and show that they lead to a better performance in this task.

研究动机与目标

  • 开发并评估用于在生物医学文献中自动检测与ADR相关句子的深度学习模型。
  • 研究句子去重对减少ADR分类中过度乐观性能估计的影响。
  • 比较通用词嵌入(GloVe)与生物医学专用词嵌入(Pyysalo et al.)在ADR检测中的有效性。
  • 在ADE语料库上评估并基准比较两种不同的CNN架构——Huynh与Hughes——在ADR相关性分类中的表现。
  • 提升ADR检测系统在制药研究药物流行病学工作流程中的可靠性与实际应用价值。

提出的方法

  • 采用两种CNN架构——Huynh与Hughes——通过词元级卷积实现句子级别的ADR相关性分类。
  • 对ADR相关句子实施去重处理,以减轻过拟合并降低评估中的过度乐观性能估计。
  • 使用预训练词嵌入:GloVe 840B(通用型)与Pyysalo et al.嵌入(生物医学专用型),以捕捉领域相关语义。
  • 在ADE语料库上训练并评估模型,该语料库包含20,960篇MEDLINE句子(4,272个与ADR相关,16,688个无关),由训练有素的专家进行标注。
  • 使用标准自然语言处理指标(包括准确率、精确率、召回率、F1得分、特异性与AUROC)评估模型性能。
  • 开展消融研究,比较包含与不包含去重处理、使用不同嵌入类型模型的性能,以分离各因素对性能的影响。

实验结果

研究问题

  • RQ1ADE语料库中ADR相关句子的去重是否能带来更真实可靠的ADR分类性能估计?
  • RQ2与通用嵌入(如GloVe)相比,生物医学专用词嵌入(如Pyysalo et al.)是否能提升ADR检测性能?
  • RQ3在ADE语料库上,Huynh架构与Hughes架构中哪一个在ADR相关句子检测中表现更优?
  • RQ4使用领域特定嵌入与去重处理在多大程度上能减少过拟合并提升ADR分类模型的泛化能力?
  • RQ5ADE语料库中注释者间不一致对模型性能上限有何影响?这对模型设计有何启示?

主要发现

  • 对ADR相关句子进行去重显著降低了性能评估中的过度乐观现象,从而实现了更可靠、更真实的模型评估。
  • 使用生物医学词嵌入(Pyysalo et al.)在所有指标上均提升了模型性能,尤其在平均精确率(0.800 vs. 0.780)与F1得分(0.798 vs. 0.790)上提升最为显著。
  • Huynh架构在所有指标上均优于Hughes架构,F1得分为0.798,AUROC为0.958,特异性为0.949。
  • AUROC从GloVe的0.954提升至生物医学嵌入的0.958,表明模型对ADR与非ADR句子的判别能力得到增强。
  • 尽管注释者间一致性较高(F1为0.77–0.80),但人类标注固有的模糊性限制了模型实现接近完美的性能潜力。
  • 去重处理、生物医学嵌入与Huynh CNN架构的结合实现了最佳整体性能,表明其可作为未来ADR检测系统的重要基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。