[论文解读] SPRINT: Ultrafast protein-protein interaction prediction of the entire human interactome
SPRINT 是一种新颖的、超高速的基于序列的算法,用于预测整个人类互作组中的蛋白质-蛋白质相互作用(PPI)。它采用间隔种子方法识别保守的序列基序,并通过共享相似性传播相互作用评分,实现了最先进的准确度,同时运行速度比现有方法快100至1000倍,且内存占用极低——使得在标准服务器上不到2小时内完成全互作组预测成为可能。
Proteins perform their functions usually by interacting with other proteins. Predicting which proteins interact is a fundamental problem. Experimental methods are slow, expensive, and have a high rate of error. Many computational methods have been proposed among which sequence-based ones are very promising. However, so far no such method is able to predict effectively the entire human interactome: they require too much time or memory. We present SPRINT (Scoring PRotein INTeractions), a new sequence-based algorithm and tool for predicting protein-protein interactions. We comprehensively compare SPRINT with state-of-the-art programs on seven most reliable human PPI datasets and show that it is more accurate while running orders of magnitude faster and using very little memory. SPRINT is the only program that can predict the entire human interactome. Our goal is to transform the very challenging problem of predicting the entire human interactome into a routine task. The source code of SPRINT is freely available from github.com/lucian-ilie/SPRINT/ and the datasets and predicted PPIs from www.csd.uwo.ca/faculty/ilie/SPRINT/.
研究动机与目标
- 为解决预测人类互作组中所有蛋白质-蛋白质相互作用这一关键挑战,此前由于计算成本过高而难以实现。
- 开发一种基于序列的 PPI 预测方法,兼具高度准确性和对整个蛋白质组的可扩展性。
- 通过使用 Park 和 Marcotte 的 C1–C3 数据集方案,消除评估中的偏差,将易预测(C1)与难预测(C2、C3)的相互作用分开。
- 在准确度和效率方面超越现有方法,特别是在最困难、具有生物学相关性的相互作用类型(C2 和 C3)上表现更优。
- 通过大幅降低时间和内存需求,使全互作组 PPI 预测成为常规计算任务。
提出的方法
- SPRINT 使用一组优化的间隔种子,识别蛋白质序列中保守的 k-mer 子序列,从而高效检测潜在的相互作用基序。
- 构建哈希表以索引人类蛋白质组中的所有间隔种子,实现快速查找和相似性计算。
- 通过识别相互作用蛋白对之间共享的间隔种子,并将其评分传播至其他蛋白对,实现相似性传播。
- 每个蛋白对 (Q₁, Q₂) 的评分使用加权公式计算,该公式考虑了支持的 k-mer 匹配数量以及蛋白长度,如公式 (3) 所定义。
- 过滤低复杂度或过度富集的区域,以减少假阳性并提高生物相关性。
- 最后,所有蛋白对根据其累积评分进行排序,得分最高的蛋白对被报告为预测的相互作用。
实验结果
研究问题
- RQ1基于序列的 PPI 预测方法是否能在扩展至整个人类互作组的同时,实现最先进的准确度?
- RQ2SPRINT 在最具挑战性的 PPI 预测场景(C2 和 C3 类型)下的表现如何,其中测试对中的任一蛋白在训练集中均未出现?
- RQ3与 Ding et al. 和 Martin et al. 等现有工具相比,使用 SPRINT 进行全互作组 PPI 预测的计算成本如何?
- RQ4使用间隔种子和相似性传播是否能显著提升预测准确度,同时保持低内存使用?
- RQ5SPRINT 是否能够在标准硬件上以实际时间范围(例如,2小时内)完成整个人类互作组预测?
主要发现
- 在所有七个可靠的、经验证的人类 PPI 数据集中,SPRINT 的准确度均高于所有评估的基于序列的方法,尤其在困难的 C2 和 C3 测试集上表现卓越。
- SPRINT 在 12 核机器上完成整个人类互作组预测仅需 15 至 100 分钟,而次快的竞争对手(Ding et al.)需数周,其他方法则需数年。
- SPRINT 的内存占用低于 1 GB,而 Ding et al. 的方法因内存需求过高,在大规模数据集上无法运行。
- 该方法基于公式 (3) 的评分传播机制,能有效通过共享序列基序,将已知 PPI 的相互作用信号传递至新蛋白对。
- SPRINT 是唯一能够在实际时间范围内完成整个人类互作组预测的工具,将此前难以处理的问题转变为常规任务。
- SPRINT 预测结果中前 1% 的 PPI 已公开发布于 www.csd.uwo.ca/faculty/ilie/SPRINT/,供社区使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。