[論文レビュー] DeepGATGO: A Hierarchical Pretraining-Based Graph-Attention Model for Automatic Protein Function Prediction
DeepGATGO は、タンパク質配列埋め込みに ESM-1b、GO タームの意味的側面に BioBERT、そしてグラフ自己注意ネットワーク(GAT)と対照的学習を用いて、遺伝子オントロジー(GO)タームの階層的構造を捉える、階層的で配列のみに依存する自動タンパク質機能予測モデルである。CAFA3 および TALE データセットにおいて最先端の性能を達成しており、構造的・相互作用的データを必要としないにもかかわらず、多様な生物種にわたるスケーラビリティと一般化性能に優れている。
Automatic protein function prediction (AFP) is classified as a large-scale multi-label classification problem aimed at automating protein enrichment analysis to eliminate the current reliance on labor-intensive wet-lab methods. Currently, popular methods primarily combine protein-related information and Gene Ontology (GO) terms to generate final functional predictions. For example, protein sequences, structural information, and protein-protein interaction networks are integrated as prior knowledge to fuse with GO term embeddings and generate the ultimate prediction results. However, these methods are limited by the difficulty in obtaining structural information or network topology information, as well as the accuracy of such data. Therefore, more and more methods that only use protein sequences for protein function prediction have been proposed, which is a more reliable and computationally cheaper approach. However, the existing methods fail to fully extract feature information from protein sequences or label data because they do not adequately consider the intrinsic characteristics of the data itself. Therefore, we propose a sequence-based hierarchical prediction method, DeepGATGO, which processes protein sequences and GO term labels hierarchically, and utilizes graph attention networks (GATs) and contrastive learning for protein function prediction. Specifically, we compute embeddings of the sequence and label data using pre-trained models to reduce computational costs and improve the embedding accuracy. Then, we use GATs to dynamically extract the structural information of non-Euclidean data, and learn general features of the label dataset with contrastive learning by constructing positive and negative example samples. Experimental results demonstrate that our proposed model exhibits better scalability in GO term enrichment analysis on large-scale datasets.
研究の動機と目的
- 構造的・相互作用的データが乏しくて正確でない既存のタンパク質機能予測手法の限界を解消すること。
- 構造的・相互作用的データに依存せず、タンパク質配列のみを用いて大規模かつ多ラベルの GO ターム予測の性能を向上させること。
- グラフ自己注意機構を用いて、GO タームの階層的で非ユークリッド的構造を効果的にモデル化すること。
- GO ターム埋め込み上で対照的学習を用いて特徴表現を向上させ、多様な生物学的種にわたる一般化性能を向上させること。
- well-annotated およびスパarsely annotated なタンパク質配列の両方で良好に動作するスケーラブルで汎用性の高いモデルを開発すること。
提案手法
- タンパク質アミノ酸配列から文脈に応じた埋め込みを ESM-1b を用いて計算する。
- 遺伝子オントロジー(GO)タームの意味的埋め込みを BioBERT を用いて生成する。
- 親子関係に基づいて、GO タームの有向無閉路グラフ(DAG)を構築し、階層的構造をモデル化する。
- 複数の自己注意ヘッドを備えたグラフ自己注意ネットワーク(GAT)を用いて、GO ターム間の動的依存関係を学習する。
- GO ターム埋め込みの正例および負例ペアを形成することで、対照的学習を導入し、表現学習を強化する。
- 学習可能な自己注意メカニズムにより、配列および GO タームの表現を統合し、構造的および意味的情報をバランスさせる学習可能なハイパーパramータ δ を用いる。
実験結果
リサーチクエスチョン
- RQ1構造的・相互作用的データに依存せず、タンパク質配列のみを用いて最先端の性能を達成できるタンパク質機能予測モデルは存在するか?
- RQ2グラフ自己注意ネットワークは、非ユークリッド的で DAG ベースのラベル空間における遺伝子オントロジー(GO)タームの階層的構造をどれほど効果的に捉えることができるか?
- RQ3機能予測のための GO ターム表現において、GAT 由来の構造的情報と BioBERT 由来の意味的情報の最適なバランスは何か?
- RQ4対照的学習は、多ラベルタンパク質機能予測における GO ターム埋め込みの一般化性能とロバスト性をどのように向上させるか?
- RQ5GAT 層における自己注意ヘッドの数が性能に与える影響はどの程度で、スケーラビリティと正確性を両立する最適な設定は何か?
主な発見
- CAFA3 データセットを用いた場合、MFO ドメインで F1 スコア 0.617、BPO で 0.528、CCO で 0.679 を達成し、以前の配列のみに依存するモデルを上回った。
- δ = 0.5 または 0.6 のときにモデルの性能が最大に達し、GAT 由来の構造的情報が予測精度向上に意味的により寄与していることが示された。
- GAT 层に 8 個の自己注意ヘッドを用いることで最適な性能が得られ、この数を超えると利得が減少し、ばらつきが増加した。
- 対照的学習により、関連のある GO タームと関係のないタームをより明確に区別できる能力が向上し、種間での一般化性能が向上した。
- モデルは優れたスケーラビリティと一般化性能を示し、CAFA3 の高頻度アノテーションデータおよび TALE のスパースアノテーションデータの両方で良好に動作した。
- 事前学習済みの配列および GO ターム埋め込みの統合により、計算コストが削減されるとともに、埋め込み品質と予測精度が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。