Skip to main content
QUICK REVIEW

[論文レビュー] An Effective GCN-based Hierarchical Multi-label classification for Protein Function Prediction

Kyudam Choi, Yurim Lee|arXiv (Cornell University)|Dec 6, 2021
Machine Learning in Bioinformatics被引用数 7
ひとこと要約

本論文では、遺伝子オントロジー(GO)用語の完全な階層的情報をエンコードするノードワイズ表現を組み込むことで、グラフ畳み込みネットワーク(GCN)を拡張する、タンパク質機能予測を目的としたGCNベースの階層的マルチラベル分類モデルを提案する。大規模なGOグラフにおける長距離依存関係を捉えるGCNと、事前学習済み言語モデルによる配列符号化を組み合わせることで、特に生物学的プロセスオントロジー(BPO)ドメインにおいてFmaxが18%向上し、最先端の性能を達成した。

ABSTRACT

We propose an effective method to improve Protein Function Prediction (PFP) utilizing hierarchical features of Gene Ontology (GO) terms. Our method consists of a language model for encoding the protein sequence and a Graph Convolutional Network (GCN) for representing GO terms. To reflect the hierarchical structure of GO to GCN, we employ node(GO term)-wise representations containing the whole hierarchical information. Our algorithm shows effectiveness in a large-scale graph by expanding the GO graph compared to previous models. Experimental results show that our method outperformed state-of-the-art PFP approaches.

研究の動機と目的

  • 大規模な遺伝子オントロジー(GO)グラフにおける長距離階層的依存関係を捉えることのできない既存のGCNベースのモデルの限界を解決すること。
  • ノード表現に完全な階層構造情報を統合することで、階層的マルチラベル分類の性能を向上させること。
  • 事前学習済み言語モデルと構造に配慮したGCNを組み合わせたスケーラブルで効果的な手法を構築し、正確なタンパク質機能アノテーションを実現すること。
  • 特に最も複雑で大規模なGOドメイン、すなわち生物学的プロセスオントロジー(BPO)において、最先端のモデルを上回ること。

提案手法

  • 本モデルは、文脈に応じたタンパク質配列表現を抽出する目的で、事前学習済み言語モデル(例:ProtBert)を配列符号化器として使用する。
  • ルートから用語に至るまでの全階層的パスをエンコードするノードワイズ表現を、各GO用語に対して構築する。これにより、遠く離れたノード間の構造的関係が保持される。
  • ノードが階層的パス情報で拡張された拡張済みGOグラフに対して、グラフ畳み込みネットワーク(GCN)を適用し、遠く離れたノード間でのメッセージ伝達を向上させる。
  • 最終的な予測は、配列符号化器の出力とGCNが学習したGO用語表現とのドット積によって計算される。
  • エポックごとの検証損失の最小化を目的に、エポック早期停止を用い、Adam最適化法と固定学習率1e-3を用いて、エンドツーエンドでモデルを訓練する。
  • GOグラフは、構造的情報を効果的に伝達できるように、階層的パスを含む形で拡張される。

実験結果

リサーチクエスチョン

  • RQ1GOノード表現に完全な階層的パス情報を組み込むことで、大規模で深いGOグラフにおけるGCN性能が向上するか?
  • RQ2本手法は、特に最も複雑なBPOドメインにおいて、最先端のモデルと比較してどのように性能を発揮するか?
  • RQ3事前学習済み言語モデルと構造に配慮したGCNを組み合わせることで、すべてのGOドメインにおいて関数予測の正確性がどの程度向上するか?
  • RQ4GOのDAGにおける長距離依存関係を捉える能力が、FmaxおよびAUPR指標に明確な向上をもたらすか?

主な発見

  • 提案手法は、生物学的プロセスオントロジー(BPO)においてFmaxスコア0.470を達成し、前回の最先端モデルTALE(0.398)に対して18%の向上を示した。
  • MFO、BPO、CCOの3つのGOドメインすべてにおいて、AUPRスコアが0.476、0.368、0.626と、すべてのベースラインモデルを上回った。
  • 過去のモデルが長距離依存関係の学習に限界を示した、最も複雑で大規模な階層的構造を有するBPOドメインにおいて、本手法は特に効果的であった。
  • 全階層的パスをエンコードするノードワイズ表現の使用は、特に深く広がったGOグラフにおいてGCN性能を顕著に向上させた。
  • 本手法は、すべてのドメインで優れた性能を維持しており、階層的マルチラベル分類における強靭性と一般化能力を示した。
  • 結果から、GCNベースのモデルに階層的構造的情報を統合することで、特に不均衡が強く複雑なラベル空間において、タンパク質機能予測の性能が顕著に向上することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。