[论文解读] Self-supervised Representation Learning on Electronic Health Records with Graph Kernel Infomax
本文提出图核互信息最大化(GKI),一种用于电子健康记录(EHR)的自监督对比学习方法,通过基于核的子空间增强技术在不修改图结构的前提下生成几何上不同的视图。该方法在临床下游任务中达到最先进性能,并在非临床图基准上表现出良好泛化能力,无需任务特定微调即可实现鲁棒性与可迁移性。
Learning Electronic Health Records (EHRs) representation is a preeminent yet under-discovered research topic. It benefits various clinical decision support applications, e.g., medication outcome prediction or patient similarity search. Current approaches focus on task-specific label supervision on vectorized sequential EHR, which is not applicable to large-scale unsupervised scenarios. Recently, contrastive learning shows great success on self-supervised representation learning problems. However, complex temporality often degrades the performance. We propose Graph Kernel Infomax, a self-supervised graph kernel learning approach on the graphical representation of EHR, to overcome the previous problems. Unlike the state-of-the-art, we do not change the graph structure to construct augmented views. Instead, we use Kernel Subspace Augmentation to embed nodes into two geometrically different manifold views. The entire framework is trained by contrasting nodes and graph representations on those two manifold views through the commonly used contrastive objectives. Empirically, using publicly available benchmark EHR datasets, our approach yields performance on clinical downstream tasks that exceeds the state-of-the-art. Theoretically, the variation on distance metrics naturally creates different views as data augmentation without changing graph structures.
研究动机与目标
- 为解决由于复杂时间特性和缺乏标签导致的EHR中无监督、可泛化患者表征学习的挑战。
- 克服在长序列、高方差EHR数据上进行数据增强时对比学习中的视图模糊问题。
- 开发一种在增强过程中保持语义结构而不改变图拓扑的方法。
- 实现通用、可迁移的患者表征,适用于多种临床任务而无需任务特定微调。
- 通过标准图基准数据集验证该方法在临床领域之外的泛化能力。
提出的方法
- 提出核子空间增强方法,利用不同的核诱导距离度量将节点和图嵌入到两个几何上不同的流形中。
- 使用图核方法将EHR的异质性与时间动态压缩为结构化的图表示。
- 通过在两个核诱导流形视图之间最大化节点与图表征之间的互信息来应用对比学习。
- 采用对比目标,在两个不同的几何空间中比较节点与图嵌入,避免结构扰动。
- 在增强过程中使用奇异值分解(SVD)进行伪逆计算,但消融实验表明其应用会导致性能下降。
- 采用参数化地标选择(K)进行子空间聚类,敏感性分析显示在不同K值下性能稳定。
实验结果
研究问题
- RQ1基于核的几何增强是否在EHR表征的对比学习中优于结构化数据增强?
- RQ2在长序列、复杂的EHR序列中,避免图拓扑修改是否能减少数据增强带来的视图模糊?
- RQ3一种无需任务特定监督的自监督方法是否能在多样化临床下游任务中实现最先进性能?
- RQ4所提方法在非临床图基准数据集上的泛化能力如何?
- RQ5SVD与伪逆计算对对比框架的学习动态与性能有何影响?
主要发现
- GKI在临床下游任务中实现最先进性能,包括治疗结果预测与患者相似性搜索,且无需任何任务特定微调。
- 在MIMIC-III基准上,GKI在宏F1与Precision@10得分上均优于现有对比学习与自监督方法,包括InfoGraph与SimCLR。
- 该方法在非临床图基准上表现出良好泛化能力,在8个标准数据集中的6个上优于最先进图对比学习方法。
- 随着地标数量K的增加,性能有所提升,但在低K值下仍保持稳定,表明对超参数选择具有鲁棒性。
- 消融实验表明,训练过程中应用SVD会降低性能,提示SVD可能通过置零奇异值而干扰学习信号。
- 该框架在不同GNN编码器上均保持强性能,其中GAT在治疗预测任务中表现更优,可能归因于注意力机制能捕捉复杂关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。