Skip to main content
QUICK REVIEW

[论文解读] Extracting Daily Dosage from Medication Instructions in EHRs: An Automated Approach and Lessons Learned

Diwakar Mahajan, Jennifer J. Liang|arXiv (Cornell University)|May 21, 2020
Biomedical Text Mining and Ontologies被引用 5
一句话总结

本文提出了一种混合NLP系统,可自动从电子健康记录(EHR)中的自由文本处方里提取所有药物的每日用药剂量,结合深度学习进行实体识别与基于规则的归一化及正则表达式匹配。在1,000个由专家标注的数据集上,该系统实现了0.95的召回率和0.98的精确率,标志着首次实现EHR中通用的每日剂量计算方法。

ABSTRACT

Medication timelines have been shown to be effective in helping physicians visualize complex patient medication information. A key feature in many such designs is a longitudinal representation of a medication's daily dosage and its changes over time. However, daily dosage as a discrete value is generally not provided and needs to be derived from free text instructions (Sig). Existing works in daily dosage extraction are narrow in scope, targeting dosage extraction for a single drug from clinical notes. Here, we present an automated approach to calculate daily dosage for all medications, combining deep learning-based named entity extractor with lexicon dictionaries and regular expressions, achieving 0.98 precision and 0.95 recall on an expert-generated dataset of 1,000 Sigs. We also analyze our expert-generated dataset, discuss the challenges in understanding the complex information contained in Sigs, and provide insights to guide future work in the general-purpose daily dosage calculation task.

研究动机与目标

  • 解决在所有药物的EHR用药说明(Sig字段)中缺乏自动化、通用的每日剂量提取方法的问题。
  • 通过实现复杂多药联用病例中准确的纵向用药时间线可视化,减轻临床认知负担。
  • 识别并分类解读自由文本Sig字段中的挑战,包括歧义性、不一致性以及约束条件缺失。
  • 开发一种在置信度较低时返回null,并对有问题的Sig进行标记以供临床医生审查的系统。
  • 通过分析Sig语言模式并识别当前基于规则的归一化方法的局限性,为未来研究提供指导。

提出的方法

  • 基于深度学习的命名实体识别器用于识别Sig文本中的关键成分,包括剂量、频率和给药途径。
  • 基于词典的归一化模块将自然语言术语(例如“每日两次”)映射到标准化的剂量单位和频率。
  • 使用正则表达式检测并提取剂量表达式,包括复杂模式如“周一-周三-周五-周六”或“隔日一次”。
  • 通过累加各次给药剂量来计算每日总剂量,并应用置信度阈值以避免低质量输出。
  • 通过将解析出的组件与专家定义的类别进行比对,识别并标记存在歧义、冲突或不完整情况的Sig。
  • 基于规则的处理流程确保了系统的鲁棒性与可解释性,未来工作计划探索端到端的序列到序列模型。

实验结果

研究问题

  • RQ1能否开发一种通用系统,准确地从EHR中所有药物的自由文本用药说明中提取每日剂量?
  • RQ2Sig字段中存在的主要语言与结构挑战是什么,这些挑战如何阻碍准确的剂量提取?
  • RQ3Sig语言中的变异(如拼写错误、PRN使用、最大剂量限制)如何影响自动化剂量计算的可靠性?
  • RQ4当前基于规则的系统中最常见的错误模式是什么,如何加以缓解?
  • RQ5能否利用专家标注的模糊或无效Sig类别来提升系统的透明度与临床安全性?

主要发现

  • 在1,000个由专家标注的数据集上,该系统实现了0.95的召回率和0.98的精确率,证明了其在每日剂量提取方面的高准确性。
  • 最常见的错误类别是“新表达式”,涉及新型或非标准表述,如“交替”或“周一-周三-周五-周六”。
  • 大量错误源于忽略最大日剂量限制或PRN例外情况,导致在未解析额外约束条件时出现剂量高估。
  • 系统在大多数情况下能正确识别并返回null处理冲突的Sig,但有两例遗漏:系统仅使用第一个表达式,导致剂量计算错误。
  • 拼写错误如“talbet”未被识别,凸显了当前归一化启发式方法的局限性。
  • 分析揭示了具有相似给药途径或剂型的药物之间存在共享的语言模式,提示未来可开展药物特定的建模工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。