Skip to main content
QUICK REVIEW

[논문 리뷰] ProtNN: Fast and Accurate Nearest Neighbor Protein Function Prediction based on Graph Embedding in Structural and Topological Space

Wajdi Dhifli, Abdoulaye Baniré Diallo|arXiv (Cornell University)|2015. 11. 02.
Machine Learning in Bioinformatics참고 문헌 33인용 수 5
한 줄 요약

ProtNN는 단백질 3D 구조를 구조적 및 위상적 공간에서 그래프 임베딩을 사용하여 표현함으로써 빠르고 정확한 단백질 기능 예측을 가능하게 하는 방법이다. 이는 FatCat 및 CE와 같은 최신 기술 대비 최대 47배 빠른 속도를 기록하며, 병렬 처리 없이 단일 프로세서에서 전체 PDB 분류를 일주일 이내에 수행할 수 있다.

ABSTRACT

Studying the function of proteins is important for understanding the molecular mechanisms of life. The number of publicly available protein structures has increasingly become extremely large. Still, the determination of the function of a protein structure remains a difficult, costly, and time consuming task. The difficulties are often due to the essential role of spatial and topological structures in the determination of protein functions in living cells. In this paper, we propose ProtNN, a novel approach for protein function prediction. Given an unannotated protein structure and a set of annotated proteins, ProtNN finds the nearest neighbor annotated structures based on protein-graph pairwise similarities. Given a query protein, ProtNN finds the nearest neighbor reference proteins based on a graph representation model and a pairwise similarity between vector embedding of both query and reference protein-graphs in structural and topological spaces. ProtNN assigns to the query protein the function with the highest number of votes across the set of k nearest neighbor reference proteins, where k is a user-defined parameter. Experimental evaluation demonstrates that ProtNN is able to accurately classify several datasets in an extremely fast runtime compared to state-of-the-art approaches. We further show that ProtNN is able to scale up to a whole PDB dataset in a single-process mode with no parallelization, with a gain of thousands order of magnitude of runtime compared to state-of-the-art approaches.

연구 동기 및 목표

  • 단백질 구조의 급격한 증가로 인해 발생하는 단백질 기능 예측 문제에 대응한다.
  • 쌍별 구조 정렬에 의존하는 기초 기반 기능 예측 방법의 계산적 병목 현상을 해결한다.
  • 3D 구조적 및 위상적 정보를 포함하면서도 과도한 계산 비용 없이도 확장 가능한 효율적인 방법을 개발한다.
  • 병렬 처리 없이 단일 프로세서 기반의 비병렬 파이프라인을 사용하여 전체 단백질 데이터베이스(PDB)에서 빠르고 정확하며 확장 가능한 기능 예측을 가능하게 한다.
  • 미해결된 단백질 구조의 대규모 기능 주석 부여를 위한 실용적인 해결책을 제공한다.

제안 방법

  • 아미노산 잔기를 노드로, 공간적 또는 접촉 기반 상호작용을 간선으로 모델링하여 각 단백질 3D 구조를 그래프로 표현한다.
  • 그래프 임베딩 기법을 적용하여 각 단백질 그래프를 고정 크기의 벡터 표현으로 변환함으로써 구조적 및 위상적 특징을 캡처한다.
  • 임베딩된 공간에서 벡터 기반 유사도 측정 방법을 사용하여 쿼리 및 기준 단백질-그래프 임베딩 간의 쌍별 유사도를 계산한다.
  • 쿼리 단백질을 k개의 가장 유사한 주석이 부여된 기준 단백질 중에서 가장 빈도가 높은 기능으로 할당함으로써 k-최근접 이웃 분류를 수행한다.
  • 전처리(그래프 구축 및 속성 계산)와 분류를 분리하여, 대규모 기준 데이터베이스에 대해 한 번만 사전 계산을 수행할 수 있도록 한다.
  • 사용자 정의된 k값을 사용하여 기능 할당의 투표 메커니즘을 제어함으로써 민감도와 특이도의 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1그래프 기반 임베딩 모델은 단백질 3D 구조의 구조적 및 위상적 특징을 기능 예측에 효과적으로 캡처할 수 있는가?
  • RQ2대규모 데이터셋에서 ProtNN의 런타임 성능은 FatCat 및 조합적 확장(Combinatorial Extension, CE)과 같은 기존 기반 기반 방법과 비교해 어떻게 되는가?
  • RQ3병렬 처리나 사전 계산된 정렬 없이도 ProtNN은 전체 PDB 수준의 기능 예측에 얼마나 잘 스케일링할 수 있는가?
  • RQ4다중 시각의 구조적 및 위상적 기술자(기능)를 통합할 경우, 시퀀스 또는 정렬 전용 방법에 비해 예측 정확도가 향상되는가?
  • RQ5전처리 및 추론 단계의 분리가 대규모 생물학적 데이터베이스를 위한 효율적이고 재사용 가능한 기능 예측 파이프라인을 가능하게 하는가?

주요 결과

  • ProtNN는 100개 단백질의 데이터셋에서 FatCat 대비 최대 47배 빠른 분류 성능을 기록하였으며, 총 런타임은 118초로 FatCat의 5570초 대비 현저히 줄었다.
  • 전체 PDB에서 단백질당 평균 분류 시간은 단지 0.1초였으며, 전체 데이터셋에 대한 종단 간 총 런타임은 6일 10시간 17분이었다.
  • ProtNN는 단일 프로세서에서 병렬 처리 없이도 전체 PDB 분류를 일주일 이내에 완료하였고, FatCat 및 CE는 두 주가 넘도록 완료되지 않았다.
  • 전처리 단계(그래프 모델링 및 속성 계산)는 단백질당 평균 5.9초가 소요되었지만, 전체 기준 데이터베이스에 대해 한 번만 수행된다.
  • 구조적 및 위상적 정보를 활용함으로써 높은 정확도를 유지하였으며, 원거리 동일성 단백질을 탐지하는 데에 시퀀스 기반 방법보다 뛰어난 성능을 보였다.
  • 이 방법은 강력한 확장성을 보였으며, 병렬 처리나 사전 계산된 정렬 없이도 전체 PDB에서 효율적인 기능 예측을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.