[论文解读] PrTransH: Embedding Probabilistic Medical Knowledge from Real World EMR Data.
PrTransH 提出了一种概率知识嵌入方法,通过在 TransH 的基础上引入概率三元组置信度、统一的损失函数以处理有效与错误三元组,以及医学背景知识增强,实现对真实世界电子病历(EMR)数据的概率知识嵌入。该方法在基于概率医学知识图谱的链接预测任务中优于 TransH,是首个针对不确定 EMR 衍生知识的此类方法。
This paper proposes an algorithm named as PrTransH to learn embedding vectors from real world EMR data based medical knowledge. The unique challenge in embedding medical knowledge graph from real world EMR data is that the uncertainty of knowledge triplets blurs the border between correct and wrong triplet, changing the fundamental assumption of many existing algorithms. To address the challenge, some enhancements are made to existing TransH algorithm, including: 1) involve probability of medical knowledge triplet into training objective; 2) replace the margin-based ranking loss with unified loss calculation considering both valid and corrupted triplets; 3) augment training data set with medical background knowledge. Verifications on real world EMR data based medical knowledge graph prove that PrTransH outperforms TransH in link prediction task. To the best of our survey, this paper is the first one to learn and verify knowledge embedding on probabilistic knowledge graphs.
研究动机与目标
- 为解决真实世界 EMR 衍生的医学知识三元组中存在的不确定性问题,该问题使得正确与错误三元组之间的界限变得模糊。
- 通过将三元组置信度分数引入训练目标,将 TransH 模型适配于概率知识图谱。
- 提升在噪声较多、真实世界 EMR 数据衍生的医学知识图谱上的链接预测性能。
- 在基于真实 EMR 的医学知识图谱上验证 PrTransH 的有效性,证明其在性能上优于标准 TransH。
提出的方法
- 提出一种概率感知的训练目标,将每个医学知识三元组的置信度水平整合进嵌入学习过程。
- 用统一损失函数替代基于边距的排序损失,联合优化有效与错误三元组,提升对不确定性的鲁棒性。
- 通过引入外部医学背景知识来扩充训练数据集,以增强泛化能力并降低对噪声的敏感性。
- 扩展 TransH 模型的向量空间投影机制,通过基于三元组可靠性加权损失贡献的方式,处理概率三元组。
- 采用改进的负采样策略,考虑三元组概率,优先从更可靠的负样本中学习。
- 采用联合优化框架,平衡嵌入质量与不确定性感知损失,以提升链接预测性能。
实验结果
研究问题
- RQ1知识嵌入模型能否有效从包含不确定三元组的真实世界 EMR 衍生的概率医学知识图谱中学习?
- RQ2与标准 TransH 相比,引入三元组置信度在链接预测性能上带来了多大提升?
- RQ3将医学背景知识引入训练数据后,对不确定 EMR 数据的模型泛化能力提升程度如何?
- RQ4是否统一损失函数(同时处理有效与错误三元组)在不确定知识图谱中优于基于边距的排序损失?
- RQ5PrTransH 是否是首个成功在概率知识图谱上学习并验证知识嵌入的方法?
主要发现
- PrTransH 在基于真实世界 EMR 的医学知识图谱上,显著优于标准 TransH 的链接预测准确率。
- 将三元组概率整合进损失函数,可在不确定性环境下实现更稳健、更可靠的嵌入学习。
- 统一损失函数通过更有效地处理有效与错误三元组,提升了模型收敛速度与性能表现。
- 在训练数据中引入医学背景知识,增强了模型对罕见或低频医学关系的泛化与预测能力。
- PrTransH 是首个成功在概率知识图谱上学习并验证知识嵌入的方法,为不确定医学知识表示设立了新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。