[논문 리뷰] SPRINT: Ultrafast protein-protein interaction prediction of the entire human interactome
SPRINT는 전체 인간 상호작용체에서 단백질-단백질 상호작용(PPI)을 예측하기 위한 새로운 초고속 시퀀스 기반 알고리즘입니다. 공통된 서열 모티프를 식별하기 위해 스페이스드-시드 접근법을 사용하며, 공유된 유사성에 따라 상호작용 점수를 전파함으로써 최신 기술 수준의 정확도를 달성하면서도 100~1,000배 빠르고 최소한의 메모리 자원을 사용합니다. 이로 인해 표준 서버에서 2시간 이내로 전체 상호작용체 예측이 가능해졌습니다.
Proteins perform their functions usually by interacting with other proteins. Predicting which proteins interact is a fundamental problem. Experimental methods are slow, expensive, and have a high rate of error. Many computational methods have been proposed among which sequence-based ones are very promising. However, so far no such method is able to predict effectively the entire human interactome: they require too much time or memory. We present SPRINT (Scoring PRotein INTeractions), a new sequence-based algorithm and tool for predicting protein-protein interactions. We comprehensively compare SPRINT with state-of-the-art programs on seven most reliable human PPI datasets and show that it is more accurate while running orders of magnitude faster and using very little memory. SPRINT is the only program that can predict the entire human interactome. Our goal is to transform the very challenging problem of predicting the entire human interactome into a routine task. The source code of SPRINT is freely available from github.com/lucian-ilie/SPRINT/ and the datasets and predicted PPIs from www.csd.uwo.ca/faculty/ilie/SPRINT/.
연구 동기 및 목표
- 기존에 계산 비용으로 인해 이행이 불가능했던 인간 상호작용체 전역에서의 단백질-단백질 상호작용 예측이라는 핵심 과제를 해결하기 위해.
- 전체 단백질집합에 스케일이 가능하면서도 높은 정확도를 보장하는 시퀀스 기반 PPI 예측 방법을 개발하기 위해.
- Park와 Marcotte의 C1–C3 데이터셋 체계를 사용하여 평가의 편향을 제거하고, 쉽게 예측 가능한(C1) 상호작용과 예측이 어려운(C2, C3) 상호작용을 분리하기 위해.
- 특히 생물학적으로 중요한 어려운 상호작용 유형(C2 및 C3)에서 기존 방법을 뛰어넘는 정확도와 효율성을 확보하기 위해.
- 시간과 메모리 요구량을 극도로 줄여 전체 상호작용체 PPI 예측을 실용적인 계산 작업으로 만드는 것.
제안 방법
- SPRINT는 최적화된 스페이스드-시드를 사용하여 단백질 서열 간의 보존된 k-mer 부분 서열을 식별함으로써 잠재적인 상호작용 모티프를 효율적으로 탐지합니다.
- 인덱스를 위해 인간 단백질집합의 모든 스페이스드-머를 해시 테이블에 저장하여 빠른 검색과 유사도 계산을 가능하게 합니다.
- 유사도 전파 과정은 상호작용하는 단백질 쌍 간에 공통된 스페이스드-머를 식별하고, 이들의 점수를 다른 단백질 쌍으로 전파함으로써 수행됩니다.
- 각 단백질 쌍(Q₁, Q₂)의 점수는 식별된 k-mer 매칭 수와 단백질 길이를 고려한 가중 공식을 사용하여 계산되며, 식 (3)에 정의되어 있습니다.
- 저복잡도 또는 과도하게 반복되는 영역은 거짓 양성 결과를 줄이고 생물학적 관련성을 향상시키기 위해 필터링됩니다.
- 마지막으로 모든 단백질 쌍은 누적 점수에 따라 순위가 매겨지며, 상위 점수를 받은 쌍이 예측된 상호작용으로 보고됩니다.
실험 결과
연구 질문
- RQ1시퀀스 기반 PPI 예측 방법이 전체 인간 상호작용체 스케일에서 최신 기술 수준의 정확도를 달성할 수 있는가?
- RQ2SPRINT는 훈련 데이터에 포함되지 않은 단백질이 있는 테스트 쌍에서 가장 도전적인 PPI 예측 시나리오(C2 및 C3 유형)에서 어떻게 성능을 발휘하는가?
- RQ3Ding 등과 Martin 등이 개발한 기존 도구와 비교해 SPRINT를 사용할 때 전체 상호작용체 PPI 예측의 계산 비용은 얼마나 되는가?
- RQ4스페이스드-시드와 유사도 전파를 사용하면 정확도를 크게 향상시키면서도 낮은 메모리 사용을 유지할 수 있는가?
- RQ5표준 하드웨어에서 SPRINT는 실용적인 시간 범위(예: 2시간 이내) 내로 전체 인간 상호작용체 예측을 완료할 수 있는가?
주요 결과
- SPRINT는 평가된 모든 일곱 개의 신뢰할 수 있는 인간 PPI 데이터셋에서 기존의 모든 시퀀스 기반 방법보다 높은 정확도를 기록했으며, 특히 어려운 C2 및 C3 테스트 세트에서 두각을 나타냈습니다.
- SPRINT는 12코어 머신에서 전체 인간 상호작용체 예측을 15분에서 100분 이내로 완료했으며, 다음으로 빠른 경쟁자(Ding 등)는 수주가 걸리고, 다른 방법들은 수년이 소요됩니다.
- SPRINT는 1GB 미만의 메모리만 사용하며, Ding 등의 방법은 과도한 메모리 요구로 대규모 데이터셋에서 실패합니다.
- 식 (3)에 기반한 점수 전파 메커니즘이 알려진 PPI에서 공통 서열 모티프를 통해 신규 쌍으로 상호작용 신호를 효과적으로 전달합니다.
- SPRINT는 유일하게 실용적인 시간 내에 전체 인간 상호작용체 예측을 완료할 수 있는 도구로서, 이전에는 해결이 어려웠던 문제를 이제는 일반적인 계산 작업으로 전환했습니다.
- SPRINT가 예측한 상호작용 중 상위 1퍼센트는 www.csd.uwo.ca/faculty/ilie/SPRINT/ 에 공개되어 공동 연구자들이 활용할 수 있습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.