[論文レビュー] ProtNN: Fast and Accurate Nearest Neighbor Protein Function Prediction based on Graph Embedding in Structural and Topological Space
ProtNN は、タンパク質の3次元構造を構造的・トポロジカルな空間に埋め込むグラフ埋め込みを用いて、高速かつ高精度にタンパク質機能予測を行う手法である。FatCat や CE といった最先端手法と比較して最大 47 倍の高速化を達成し、並列化を行わず単一プロセッサで動作させても、PDB 全体の分類処理を1週間未満で完了できる。
Studying the function of proteins is important for understanding the molecular mechanisms of life. The number of publicly available protein structures has increasingly become extremely large. Still, the determination of the function of a protein structure remains a difficult, costly, and time consuming task. The difficulties are often due to the essential role of spatial and topological structures in the determination of protein functions in living cells. In this paper, we propose ProtNN, a novel approach for protein function prediction. Given an unannotated protein structure and a set of annotated proteins, ProtNN finds the nearest neighbor annotated structures based on protein-graph pairwise similarities. Given a query protein, ProtNN finds the nearest neighbor reference proteins based on a graph representation model and a pairwise similarity between vector embedding of both query and reference protein-graphs in structural and topological spaces. ProtNN assigns to the query protein the function with the highest number of votes across the set of k nearest neighbor reference proteins, where k is a user-defined parameter. Experimental evaluation demonstrates that ProtNN is able to accurately classify several datasets in an extremely fast runtime compared to state-of-the-art approaches. We further show that ProtNN is able to scale up to a whole PDB dataset in a single-process mode with no parallelization, with a gain of thousands order of magnitude of runtime compared to state-of-the-art approaches.
研究の動機と目的
- タンパク質構造の増加に伴い深刻化するタンパク質機能予測の課題に対処する。
- 2次元構造アラインメントに依存する構造ベースの機能予測手法における計算上のボトルネックを克服する。
- 3次元構造的・トポロジカルな情報を組み込みつつ、計算コストが著しく増大しないスケーラブルで効率的な手法を開発する。
- 並列化を一切行わず単一プロセスで動作するパイプラインを用いて、タンパク質データバンク(PDB)全体にわたる高速かつ高精度でスケーラブルな機能予測を実現する。
- 未同定タンパク質構造の広範囲にわたる機能アノテーションに実用的なソリューションを提供する
提案手法
- アミノ酸残基をノード、空間的または接触ベースの相互作用をエッジとしてモデル化することで、各タンパク質3次元構造をグラフとして表現する。
- グラフ埋め込み技術を用いて、各タンパク質グラフを構造的・トポロジカルな特徴を捉えた固定長のベクトル表現に変換する。
- 埋め込み空間内でのベクトルベースの類似度測定により、クエリとリファレンスタンパク質グラフ埋め込み間の類似度を計算する。
- k 個の類似度の高い注釈済みリファレンスタンパク質のうち、最も頻度が高い機能をクエリタンパク質に割り当てる k-最近傍法分類を実行する。
- 前処理(グラフ構築および属性計算)と分類を分離し、大規模なリファレンスデータベースに対して一度だけ事前計算を行うことを可能にする。
- ユーザーが指定する k 値を用いて関数割り当ての投票メカニズムを制御し、感度と特異度のバランスをとる
実験結果
リサーチクエスチョン
- RQ1グラフベースの埋め込みモデルは、タンパク質3次元構造の構造的・トポロジカルな特徴を、機能予測に有効に捉えられるか?
- RQ2大規模データセット上で、ProtNN の実行時間性能は FatCat やコンビネトリアルエクステンション(CE)といった確立された構造ベース手法と比べてどの程度優れているか?
- RQ3並列化や事前計算されたアラインメントを一切用いずに、PDB 全体にわたる機能予測にどの程度スケーリング可能か?
- RQ4構造的・トポロジカルな記述子を複数視点で組み込むことで、配列またはアラインメントのみに依存する手法と比較して、予測精度が向上するか?
- RQ5前処理と推論ステップの分離により、大規模な生物学的データベース向けに効率的かつ再利用可能な機能予測パイプラインを構築できるか?
主な発見
- 100タンパク質のデータセット上で、ProtNN は FatCat より最大 47 倍の高速化を達成し、合計実行時間は 118 秒(FatCat は 5570 秒)であった。
- PDB 全体の平均分類時間は 1 蛋白質あたりわずか 0.1 秒であり、全データセットのエンドツーエンド実行時間は 6 日 10 時間 17 分であった。
- ProtNN は単一プロセッサで動作させた場合、PDB 全体の分類処理を1週間未満で完了したが、FatCat や CE は2週間以内に完了しなかった。
- 前処理フェーズ(グラフモデリングおよび属性計算)の平均所要時間は 1 蛋白質あたり 5.9 秒であったが、これはリファレンスデータベース全体に対して一度だけ実行される。
- 構造的・トポロジカルな情報を活用することで高い精度を維持し、遠隔相同体の検出において配列ベース手法を上回った。
- 本手法は強力なスケーラビリティを示し、並列化や事前計算されたアラインメントを一切必要とせず、PDB 全体にわたる効率的な機能予測を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。