QUICK REVIEW
[论文解读] Unsupervised Pseudo-Labeling for Extractive Summarization on Electronic Health Records
Xiangan Liu, Keyang Xu|arXiv (Cornell University)|Nov 20, 2018
Machine Learning in Healthcare参考文献 14被引用 9
一句话总结
本文提出了一种用于电子健康记录(EHR)抽取式摘要的无监督伪标签方法,利用纵向临床记录之间的内在相关性。通过利用与疾病相关的医学实体以及整数线性规划(ILP)生成伪标签,该方法训练了一个监督神经模型,在ROUGE分数上优于无监督基线方法,实现了无需人工标注摘要的最先进性能。
ABSTRACT
Extractive summarization is very useful for physicians to better manage and digest Electronic Health Records (EHRs). However, the training of a supervised model requires disease-specific medical background and is thus very expensive. We studied how to utilize the intrinsic correlation between multiple EHRs to generate pseudo-labels and train a supervised model with no external annotation. Experiments on real-patient data validate that our model is effective in summarizing crucial disease-specific information for patients.
研究动机与目标
- 通过消除对人工标注标签的需求,解决为抽取式摘要标注EHR所带来的高成本问题。
- 通过利用同一患者多个临床笔记之间的内在相关性,提升摘要性能。
- 开发一种利用与疾病相关的医学实体及笔记间的时间一致性生成高质量伪标签的方法。
- 基于这些伪标签训练监督神经模型,以实现超越无监督方法的泛化能力。
- 验证引入新颖性和位置特征在提升摘要质量方面的有效性。
提出的方法
- 基于后期笔记中的疾病相关医学实体,结合逆文档频率(IDF)和语义相似度,使用覆盖率分数衡量摘要质量。
- 采用整数线性规划(ILP)定义伪标签目标,以在长度约束下最大化相关实体的覆盖率。
- 使用预训练的PubMed词嵌入和平均池化,计算实体与句子之间的语义相似度。
- 采用基于Bi-GRU的神经模型结合注意力机制,学习上下文感知的句子表示,用于抽取式摘要。
- 通过最大边际相关性(MMR)引入新颖性,并加入位置偏差,以减少冗余并提升句子选择效果。
- 对优化目标中的非光滑最大操作应用log-sum-exp近似以实现可微分处理。
实验结果
研究问题
- RQ1如何衡量同一患者疾病特异性摘要的质量?
- RQ2基于RQ1中的标准,如何生成最能满足该标准的伪标签?
- RQ3在RQ2生成的伪标签基础上,医疗场景中应采用何种模型架构进行摘要?
- RQ4新颖性和位置特征如何影响摘要性能?
主要发现
- 所提方法在ROUGE-1(0.53)、ROUGE-2(0.38)和ROUGE-L(0.51)上均取得最高分,优于所有无监督基线方法。
- 移除新颖性组件后,ROUGE-1降至0.48,ROUGE-2降至0.33,表明其在减少冗余方面具有重要意义。
- 排除位置特征后,ROUGE-1提升至0.50,ROUGE-L提升至0.49,表明位置偏差在模板化临床笔记中能增强性能。
- 该方法正确排除了非临床指导内容(如患者自我护理提醒),而无监督方法(如TF-IDF + MMR)则错误选中了这些内容。
- 与基于实体贪婪的方法相比,该模型在识别短小但高影响力的句子(如“慢性收缩性心力衰竭”)方面表现出更优能力。
- 通过ILP生成的伪标签有效捕捉了疾病特异性相关性,使神经模型的泛化能力优于无监督方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。