[论文解读] Validating transformers for redaction of text from electronic health records in real-world healthcare
本文提出 AnonCAT,一种基于微调的 Transformer 模型,用于在真实医疗环境中对电子健康记录(EHR)进行去识别。该模型在来自三家英国医院、具有不同 EHR 系统的 3,116 份手动标注的 EHR 上进行训练,所有站点的召回率均达到极高水平(0.99、0.99 和 0.96),表明对基础模型进行本地化、持续微调,可实现准确、灵活且可维护的受保护健康信息(PHI)去标识化。
Protecting patient privacy in healthcare records is a top priority, and redaction is a commonly used method for obscuring directly identifiable information in text. Rule-based methods have been widely used, but their precision is often low causing over-redaction of text and frequently not being adaptable enough for non-standardised or unconventional structures of personal health information. Deep learning techniques have emerged as a promising solution, but implementing them in real-world environments poses challenges due to the differences in patient record structure and language across different departments, hospitals, and countries. In this study, we present AnonCAT, a transformer-based model and a blueprint on how deidentification models can be deployed in real-world healthcare. AnonCAT was trained through a process involving manually annotated redactions of real-world documents from three UK hospitals with different electronic health record systems and 3116 documents. The model achieved high performance in all three hospitals with a Recall of 0.99, 0.99 and 0.96. Our findings demonstrate the potential of deep learning techniques for improving the efficiency and accuracy of redaction in global healthcare data and highlight the importance of building workflows which not just use these models but are also able to continually fine-tune and audit the performance of these algorithms to ensure continuing effectiveness in real-world settings. This approach provides a blueprint for the real-world use of de-identifying algorithms through fine-tuning and localisation, the code together with tutorials is available on GitHub (https://github.com/CogStack/MedCAT).
研究动机与目标
- 解决基于规则的去标识化方法在处理医疗机构中非标准化、多样化且不断演变的 EHR 结构时的局限性。
- 评估深度学习模型(特别是 Transformer)在具有异构 EHR 系统的真实临床环境中进行去标识化的可行性与性能。
- 通过支持本地微调和持续性能审计,开发一种实用、可扩展的 NLP 模型部署与维护工作流程。
- 在保持高召回率的同时,减少对临床相关信息的过度去标识化。
- 将模型部署整合到现有医院信息治理工作流程中,以最小化额外负担,并支持模型的持续改进。
提出的方法
- AnonCAT 基于 MedCAT 构建,MedCAT 是一种用于命名实体识别与链接(NER+L)的医疗 NLP 工具包,通过替换或删除检测到的 PHI 实体,使其适用于去标识化任务。
- 该模型使用来自三家英国医院的 3,116 份真实 EHR 文档进行微调,这些医院拥有不同的 EHR 系统,标注了 14 种 PHI 类型,包括姓名、地址和 NHS 号码。
- 采用多步标注与验证流程,通过迭代方式解决模型预测与人工标注者之间的分歧,重点聚焦于被遗漏的 PHI 实例。
- 使用标准 NLP 指标评估性能:精确率、召回率和 F1 分数,报告了不同 PHI 类别下的实体级别与合并指标。
- 在零样本和少样本设置下进行测试——评估在未进行微调的新医院数据集上的性能(KCH 模型在 GSTT 数据上的表现)以及使用 150–300 份文档微调后的性能。
- 探索了一种偏差策略以平衡精确率与召回率,并在 GSTT 数据集上使用两个模型进行了权衡分析:仅在 KCH 数据上训练的 AnonCAT 和 Philter 作为基线。

实验结果
研究问题
- RQ1基于 Transformer 的模型能否在仅使用极少领域特定数据的情况下,实现在多样化医院 EHR 系统中高召回率与高精确率的 EHR 去标识化?
- RQ2使用 150–300 份文档的少样本微调,在多大程度上能有效将预训练的基础模型适配到新医疗机构的 EHR 结构与语言模式?
- RQ3数据漂移与机构间结构差异对预训练去标识化模型性能的影响如何?又该如何缓解?
- RQ4对于复杂临床文本中的 PHI 标注数据集,相较于双重标注,基于模型辅助的迭代验证是否更高效?
- RQ5现有医院信息治理工作流程在多大程度上可被调整以支持持续的模型审计与微调?
主要发现
- AnonCAT 在三个不同医院的数据集上分别实现了 0.99、0.99 和 0.96 的召回率,表明其在多样化 EHR 系统与语言结构中均具有高度有效性。
- 仅使用 150–300 份人工标注文档进行微调,即可显著提升模型在新数据集上的性能,且随着微调文档数量的增加,性能进一步提升。
- 绝大多数标注错误(90%)源于人工标注者遗漏了 PHI,而非误标,表明对于困难的检测任务,模型辅助的迭代验证比双重标注更高效。
- 即使是最先进的现成工具(如 Philter),在新数据集上实现 95% 或以上的召回率也需进行微调,凸显了本地化适配的必要性。
- 该模型在不同 PHI 类型上的表现稳健,关键实体(如 NHS 号码,F1 = 0.83;日期,F1 = 0.83)的 F1 分数较高,表明其具备强大的泛化能力。
- 通过偏向更高召回率进行模型偏差调整,可提升整体性能,但代价是精确率下降,凸显了在临床部署中需谨慎权衡此二者。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。