Skip to main content
QUICK REVIEW

[论文解读] Feature-Augmented Neural Networks for Patient Note De-identification

Ji Young Lee, Franck Dernoncourt|arXiv (Cornell University)|Oct 30, 2016
Machine Learning in Healthcare参考文献 17被引用 3
一句话总结

本文提出了一种基于LSTM和字符嵌入的序列标注模型的特征增强神经网络,用于患者病历去标识化,将人工设计特征与电子健康记录(EHR)衍生特征整合到现有模型中。EHR衍生特征的引入——尤其是患者和医生姓名——显著提升了召回率,特别是对于患者姓名等敏感隐私信息(PHI)类型,达到了99.27%的召回率,代表了当前最先进性能的关键进展。

ABSTRACT

Patient notes contain a wealth of information of potentially great interest to medical investigators. However, to protect patients' privacy, Protected Health Information (PHI) must be removed from the patient notes before they can be legally released, a process known as patient note de-identification. The main objective for a de-identification system is to have the highest possible recall. Recently, the first neural-network-based de-identification system has been proposed, yielding state-of-the-art results. Unlike other systems, it does not rely on human-engineered features, which allows it to be quickly deployed, but does not leverage knowledge from human experts or from electronic health records (EHRs). In this work, we explore a method to incorporate human-engineered features as well as features derived from EHRs to a neural-network-based de-identification system. Our results show that the addition of features, especially the EHR-derived features, further improves the state-of-the-art in patient note de-identification, including for some of the most sensitive PHI types such as patient names. Since in a real-life setting patient notes typically come with EHRs, we recommend developers of de-identification systems to leverage the information EHRs contain.

研究动机与目标

  • 提升基于神经网络的患者病历去标识化系统的召回率,这对保护患者隐私至关重要。
  • 探究在端到端神经模型中整合人工设计特征与EHR衍生特征是否能够超越当前最先进水平。
  • 评估结构化EHR数据(如患者和医生姓名)在真实临床环境中对去标识化准确率的影响。
  • 确定特征整合是否能提升对敏感PHI类型(尤其是最隐私敏感的患者姓名)的检测能力。
  • 分析在将多样化特征类型与神经模型结合时,精确率与召回率之间的权衡。

提出的方法

  • 该方法在基于LSTM和字符增强嵌入的先前神经网络模型基础上,扩展了一个前馈神经网络,用于处理每个标记的二值特征。
  • 特征包括人工设计的模式(如日期、电话号码的正则表达式)以及来自相关EHR数据库的EHR衍生特征,如患者和医生姓名。
  • 前馈网络的输出与输入层的标记嵌入拼接,使模型能够联合学习原始嵌入与工程化特征。
  • 模型使用跨所有层的联合训练目标,包括应用条件随机场(CRF)以预测最可能的标签序列的标签序列优化层。
  • 系统通过反向传播进行端到端训练,超参数通过五次运行的交叉验证进行优化。
  • 评估在标准去标识化数据集上进行,性能通过每类PHI的精确率、召回率和F1分数衡量。

实验结果

研究问题

  • RQ1整合EHR衍生特征(如患者和医生姓名)是否能提升基于神经网络的去标识化系统的召回率?
  • RQ2添加人工设计特征是否会降低或提升神经模型的性能,特别是对罕见或复杂PHI类型?
  • RQ3与不使用特征的基线神经模型相比,特征增强模型在不同PHI类型上的性能表现如何?
  • RQ4为何在包含所有特征时,尽管精确率提高,召回率反而下降?模型对格式错误的PHI实例为何表现出敏感性?
  • RQ5在实际临床部署中,结构化EHR数据在多大程度上可被利用以增强去标识化能力?

主要发现

  • 仅使用EHR衍生特征的模型在十二类PHI中的六类中实现了最高召回率,包括患者姓名的99.14%召回率和医生姓名的98.48%召回率。
  • 引入EHR衍生特征后,患者姓名的召回率提升至99.27%,这是该敏感PHI类型报告的最高值,且该结果在两个假阴性由标注错误导致的情况下依然稳健。
  • 使用所有特征(EHR + 人工设计)的模型相比仅使用EHR特征的模型,召回率略有下降,尤其在电话号码和街道地址上,原因是对严格正则表达式的过拟合。
  • 对于患者姓名,使用EHR特征的模型实现了99.27%的召回率,显著优于无特征基线模型,证明了EHR上下文的价值。
  • 当使用EHR特征时,系统在邮编上达到100%的F1分数,在电话号码上达到99.37%的F1分数,表明精确率与召回率之间具有良好的平衡。
  • 在处理格式错误的电话号码(如带扩展号或缺少数字)时,使用EHR特征的模型表现更优,表明其在模式匹配之外具备更好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。