[論文レビュー] SPRINT: Ultrafast protein-protein interaction prediction of the entire human interactome
SPRINT は、全ヒトインタラクトーム上でタンパク質間相互作用(PPI)を予測する、画期的で超高速な逐次ベースのアルゴリズムである。同アルゴリズムは、保存配列モチーフを同定するためのスペーシング・シード手法を用い、類似性を共有するものに基づいて相互作用スコアを伝搬させる。これにより、最先端の正確性を達成するとともに、100~1,000倍高速に動作し、最小限のメモリ使用量で、標準サーバー上で全インタラクトーム予測を2時間未塔で実行可能にする。
Proteins perform their functions usually by interacting with other proteins. Predicting which proteins interact is a fundamental problem. Experimental methods are slow, expensive, and have a high rate of error. Many computational methods have been proposed among which sequence-based ones are very promising. However, so far no such method is able to predict effectively the entire human interactome: they require too much time or memory. We present SPRINT (Scoring PRotein INTeractions), a new sequence-based algorithm and tool for predicting protein-protein interactions. We comprehensively compare SPRINT with state-of-the-art programs on seven most reliable human PPI datasets and show that it is more accurate while running orders of magnitude faster and using very little memory. SPRINT is the only program that can predict the entire human interactome. Our goal is to transform the very challenging problem of predicting the entire human interactome into a routine task. The source code of SPRINT is freely available from github.com/lucian-ilie/SPRINT/ and the datasets and predicted PPIs from www.csd.uwo.ca/faculty/ilie/SPRINT/.
研究の動機と目的
- 計算コストの高さにより、これまで実行不可能であったヒトインタラクトーム全体における全タンパク質間相互作用予測という、極めて重要な課題に取り組むこと。
- 全プロテオームにスケーラブルでありながら、極めて高い正確性を有する逐次ベースのPPI予測手法を開発すること。
- パークとマルコットのC1–C3データセット方式を用いて、容易(C1)と予測が難しい(C2、C3)相互作用を分離することで、評価におけるバイアスを排除すること。
- 特に予測が困難で生物学的に重要な相互作用タイプ(C2およびC3)において、既存手法を上回る正確性と効率性を達成すること。
- 時間的・メモリ的要件を著しく削減することで、全インタラクトームPPI予測を日常的な計算タスクにすること。
提案手法
- SPRINT は最適化されたスペーシング・シードの集合を用い、タンパク質配列全体にわたる保存されたk-mer部分列を特定することで、潜在的な相互作用モチーフの効率的同定を可能にする。
- ヒトプロテオームからのすべてのスペーシング・マーチャーをインデックス化するハッシュテーブルを構築し、高速な検索と類似性計算を実現する。
- 類似性伝搬は、相互作用を示すタンパク質ペア間で共有されるスペーシング・マーチャーを特定し、それらのスコアを他のタンパク質ペアへ伝搬することで実行される。
- 各タンパク質ペア (Q₁, Q₂) のスコアは、式 (3) で定義される重み付き式により計算され、支持するk-mer一致数とタンパク質の長さを考慮する。
- 低複雑性または過剰に出現する領域は除外され、誤検出の低減と生物学的妥当性の向上が図られる。
- 最後に、すべてのタンパク質ペアが累積スコア順にランク付けされ、上位スコアのペアが予測された相互作用として報告される。
実験結果
リサーチクエスチョン
- RQ1逐次ベースのPPI予測手法として、全ヒトインタラクトームにスケーリング可能な状況下で、最先端の正確性を達成できるか?
- RQ2訓練データに含まれないタンパク質ペアが含まれる、最も困難なPPI予測シナリオ(C2およびC3タイプ)において、SPRINTの性能はいかがなものか?
- RQ3DingらやMartinらのような既存ツールと比較して、SPRINTを用いた全インタラクトームPPI予測の計算コストはどの程度か?
- RQ4スペーシング・シードと類似性伝搬の使用が、低メモリ使用量を維持したまま、予測正確性を著しく向上できるか?
- RQ5標準ハードウェア上で、SPRINTが実用的な時間枠(例:2時間未満)で全ヒトインタラクトーム予測を完了できるか?
主な発見
- SPRINT は、全7つの信頼性の高いヒトPPIデータセットにおいて、評価されたすべての逐次ベース手法の中で最高の正確性を達成しており、特に予測が困難なC2およびC3テストセットで顕著な優位性を示している。
- SPRINT は12コアマシン上で全ヒトインタラクトーム予測を15~100分で完了するが、次に速い競合製品(Ding ら)ですら数週間を要し、他の手法では数年を要する。
- SPRINT は1 GB未満のメモリ使用量であるのに対し、Ding らの手法は大規模データセットで過剰なメモリ要件のため失敗する。
- 式 (3) に基づくスコア伝搬メカニズムにより、共有配列モチーフを通じて既知のPPIから新しいペアへ相互作用信号を効果的に伝搬できる。
- SPRINT は、全インタラクトーム予測を実用的な時間枠で完了できる唯一のツールであり、かつて処理不能とされた問題を日常的なタスクに変革した。
- SPRINT が予測した上位1%のPPIは、www.csd.uwo.ca/faculty/ilie/SPRINT/ でコミュニティ利用のために公開されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。