Skip to main content
QUICK REVIEW

[论文解读] Temporal Positive-unlabeled Learning for Biomedical Hypothesis Generation via Risk Estimation

Uchenna Akujuobi, Jun Chen|arXiv (Cornell University)|Oct 5, 2020
Biomedical Text Mining and Ontologies参考文献 19被引用 9
一句话总结

本文提出TRP,一种用于生物医学假说生成的时序正样本-未标记样本(PU)学习框架,通过变分推断估计正样本先验,对学术文献中动态术语关系进行建模。通过在一系列随时间演化的属性图结构上学习节点对嵌入,TRP在预测未来术语关系方面优于最先进PU方法,包括新型、未观测到的关联(如烟草与COVID-19之间的关联)。

ABSTRACT

Understanding the relationships between biomedical terms like viruses, drugs, and symptoms is essential in the fight against diseases. Many attempts have been made to introduce the use of machine learning to the scientific process of hypothesis generation(HG), which refers to the discovery of meaningful implicit connections between biomedical terms. However, most existing methods fail to truly capture the temporal dynamics of scientific term relations and also assume unobserved connections to be irrelevant (i.e., in a positive-negative (PN) learning setting). To break these limits, we formulate this HG problem as future connectivity prediction task on a dynamic attributed graph via positive-unlabeled (PU) learning. Then, the key is to capture the temporal evolution of node pair (term pair) relations from just the positive and unlabeled data. We propose a variational inference model to estimate the positive prior, and incorporate it in the learning of node pair embeddings, which are then used for link prediction. Experiment results on real-world biomedical term relationship datasets and case study analyses on a COVID-19 dataset validate the effectiveness of the proposed model.

研究动机与目标

  • 解决现有假说生成方法的局限性,即假设未观测到的术语关系为负,违背了科学发现中的开放世界假设。
  • 使用1945年至2020年间的序列图结构构建的动态属性图,建模生物医学术语关系的时序演化。
  • 将假说生成建模为在动态图上基于正-未标记(PU)学习设置的未来连通性预测任务,其中未标记边是正样本和负样本的混合。
  • 开发一种基于变分推断的方法,从未标记数据和正样本中估计正样本先验,避免依赖先验知识或标记负样本。
  • 实现端到端的节点对嵌入学习,以捕捉时序动态并支持对新型生物医学假说的准确链接预测。

提出的方法

  • 将生物医学术语关系表示为动态属性图 $G = \{G^1, G^2, ..., G^T\}$,其中每个 $G^t$ 是一个具有节点 $V^t$、边 $E^t$ 和节点属性 $x_v^t$ 的时间图结构。
  • 将假说生成定义为基于 $t=1$ 到 $T$ 期间 $E^t$ 的演化,预测 $V^T$ 中未连接节点之间的未来链接。
  • 应用正-未标记(PU)学习,将未观测到的边视为正样本和负样本的混合,而非假设其全部为负。
  • 引入变分推断模型,从未标记数据和正样本中估计正样本先验 $\pi$,即观测到正样本的概率。
  • 使用结合了估计正样本先验的节点对嵌入训练链接预测模型,以最小化PU学习设置下的无偏风险。
  • 使用学习到的嵌入进行链接预测,模型在1945–2020年真实世界生物医学术语共现数据上进行端到端训练。

实验结果

研究问题

  • RQ1PU学习框架能否有效建模动态科学文献中生物医学术语关系的时序演化?
  • RQ2与固定或启发式先验假设相比,基于变分推断的正样本先验估计在链接预测性能上表现如何?
  • RQ3该模型在多大程度上能检测到新颖的、未观测到但具有生物学合理性的术语关系(如烟草与COVID-19之间的关系),这些关系未出现在训练数据中?
  • RQ4所提出的时序PU学习方法是否在生物医学图的未来连通性预测任务中优于传统的正-负(PN)学习和静态PU学习方法?
  • RQ5学习到的节点对嵌入在嵌入空间中对真实正样本与负样本及未观测正样本的分离效果如何?

主要发现

  • TRP在包含3万节点和100万至200万条边的真实世界生物医学术语关系数据集上,显著优于最先进PU学习方法。
  • 该模型成功预测了新颖且具有生物学合理性的关系,例如烟草与COVID-19之间的关联,这些关系在训练数据中未被观测到,但得到了后续文献的支持。
  • 学习到的嵌入可视化显示清晰聚类:真实正样本(蓝色)与预测负样本(红色)明显分离,而未观测正样本(绿色)则靠近真实正样本,验证了PU假设。
  • 基于变分推断的正样本先验估计相比固定先验假设,提升了模型泛化能力并降低了风险估计偏差。
  • 该模型有效捕捉了时序动态,表明对术语关系随时间演化的建模可提升假说生成性能。
  • 案例研究证实,该方法能够从历史科学文献中生成有意义、可解释且及时的生物医学假说。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。