Skip to main content
QUICK REVIEW

[论文解读] Network embedding unveils the hidden interactions in the mammalian virome

Timothée Poisot, Marie-Andrée Ouellet|arXiv (Cornell University)|May 31, 2021
HIV Research and Treatment被引用 4
一句话总结

本研究提出了一种新颖的LF-SVD方法,结合线性滤波与奇异值分解,用于预测哺乳动物病毒组中隐藏且未被实现的宿主-病毒相互作用。通过利用网络结构和低秩插补,该方法恢复了具有生物合理性的关联,揭示了亚马逊雨林是未采样病毒组多样性的全球热点,并通过图嵌入病毒特征提升了人畜共患风险预测能力。

ABSTRACT

At most 1-2% of the global virome has been sampled to date. Recent work has shown that predicting which host-virus interactions are possible but undiscovered or unrealized is, fundamentally, a network science problem. Here, we develop a novel method that combines a coarse recommender system (Linear Filtering; LF) with an imputation algorithm based on low-rank graph embedding (Singular Value Decomposition; SVD) to infer host-virus associations. This combination of techniques results in informed initial guesses based on directly measurable network properties (density, degree distribution) that are refined through SVD (which is able to leverage emerging features). Using this method, we recovered highly plausible undiscovered interactions with a strong signal of viral coevolutionary history, and revealed a global hotspot of unusually unique but unsampled (or unrealized) host-virus interactions in the Amazon rainforest. We develop several tests for quantifying the bias and realism of these predictions, and show that the LF-SVD method is robust in each aspect. We finally show that graph embedding of the imputed network can be used to improve predictions of human infection from viral genome features, showing that the global structure of the mammal-virus network provides additional insights into human disease emergence.

研究动机与目标

  • 为解决当前全球病毒组研究中采样率不足1-2%的严重信息缺口。
  • 在高稀疏性、部分观测的网络中预测具有生物合理性的但尚未实现的宿主-病毒相互作用。
  • 在保留宿主-病毒关联共进化信号的同时,减少网络预测中的采样偏差。
  • 通过将全局网络结构整合进基于病毒基因组的模型,提升人畜共患风险预测能力。
  • 检验从插补网络中提取的图嵌入特征是否能提升基于病毒基因组组成预测人类感染风险的准确性。

提出的方法

  • LF-SVD方法使用线性滤波(LF)基于网络属性(入度、出度和连通性)生成初始相互作用概率。
  • 对网络邻接矩阵的低秩近似应用奇异值分解(SVD),以插补缺失或未实现的相互作用。
  • 通过选择最优矩阵秩(最佳模型中为12阶)并加权连通性而非度数,以最大化信息利用效率,从而减少采样偏差。
  • 使用随机点积图分解法对观测网络和插补网络进行图嵌入,从左奇异子空间中提取潜在特征(12维)。
  • 将这些潜在特征与病毒基因组组成度量相结合,训练梯度提升树模型以预测人畜共患潜力。
  • 为防止数据泄露,在生成嵌入时排除仅与人类宿主相关的病毒和宿主,并通过重复1000次的训练-校准-测试分割来验证模型性能。

实验结果

研究问题

  • RQ1基于网络的方法能否在稀疏采样的病毒组中推断出具有生物合理性的但尚未实现的宿主-病毒相互作用?
  • RQ2LF-SVD方法是否在保留宿主-病毒关联共进化信号的同时,降低了采样偏差的影响?
  • RQ3亚马逊雨林是否如网络插补所示,是未被发现的宿主-病毒相互作用的全球热点?
  • RQ4从插补网络中提取的图嵌入特征是否能提升仅基于病毒基因组组成预测人畜共患潜力的准确性?
  • RQ5将全局网络结构整合进模型是否能提升预测哪些哺乳动物病毒可感染人类的准确性?

主要发现

  • LF-SVD方法在预测已知宿主-病毒相互作用时AUC达到0.84,表明其在部分观测网络上具有出色的预测性能。
  • 插补使预测相互作用数量增加了约15倍,表明存在大量此前未被检测或未实现的宿主-病毒关联。
  • 亚马逊雨林被识别为独特且未被采样的宿主-病毒相互作用的全球热点,LCBD分析显示其病毒群落组成独特性高于其他地区。
  • 该模型显著降低了被动采样偏差的影响:插补后,引用次数对预测病毒丰富度的影响减弱,表明预测偏差减少。
  • 从插补网络中提取的图嵌入显著提升了人畜共患风险预测性能,最佳模型在结合病毒基因组特征与插补网络嵌入后AUC更高。
  • 最终模型基于基因组组成与插补网络嵌入进行训练,通过集成多个表现最佳模型的平均预测,成功预测了612种病毒的人类感染概率,并提升了准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。