Skip to main content
QUICK REVIEW

[論文レビュー] Protein model quality assessment using rotation-equivariant, hierarchical neural networks

Stephan Eismann, Patricia Suriana|arXiv (Cornell University)|Nov 27, 2020
Protein Structure and Dynamics参考文献 17被引用数 5
ひとこと要約

本論文では、物理的エネルギー項や外部データを一切使用せずに、原子座標のみを用いてタンパク質構造モデルのスコアを付ける回転等長性で階層的な深層学習モデルを提案する。この手法は、CASP11およびCASP12ベンチマークで最先端の性能を達成し、CASP12ではターゲットごとのスピアーマン相関係数が0.62を記録した。これは、複数スケールでの構造モチーフのエンドツーエンド学習により、きわめて頑健な品質評価を実現していることを示している。

ABSTRACT

Proteins are miniature machines whose function depends on their three-dimensional (3D) structure. Determining this structure computationally remains an unsolved grand challenge. A major bottleneck involves selecting the most accurate structural model among a large pool of candidates, a task addressed in model quality assessment. Here, we present a novel deep learning approach to assess the quality of a protein model. Our network builds on a point-based representation of the atomic structure and rotation-equivariant convolutions at different levels of structural resolution. These combined aspects allow the network to learn end-to-end from entire protein structures. Our method achieves state-of-the-art results in scoring protein models submitted to recent rounds of CASP, a blind prediction community experiment. Particularly striking is that our method does not use physics-inspired energy terms and does not rely on the availability of additional information (beyond the atomic structure of the individual protein model), such as sequence alignments of multiple proteins.

研究の動機と目的

  • 物理的エネルギー項や追加の生物学的データを一切使用せず、原子座標のみに依存する深層学習手法を用いてタンパク質モデルの品質評価を実現すること。
  • 計算タンパク質構造予測における主要なブottleneckである、多数の候補モデルの順位付け精度を向上させること。
  • 回転等長性畳み込みを活用することで、回転や方向に依存しない構造モチーフを認識できるようにネットワークを設計すること。
  • 局所的な原子間相互作用を捉えるために、複数の解像度レベルでタンパク質構造の階層的表現を学習すること。

提案手法

  • 原子をポイントベースの表現で扱い、初期特徴ベクトルは元素種別のワンホットエンコーディング(C, O, N, S)から得る。
  • 球面調和関数を用いて、$ l=2 $ までの回転等長性畳み込みを適用し、構造モチーフの検出を方向に依存せずに可能にする。
  • 局所性を確保するため、k近傍(k=40)に基づく畳み込み層を採用し、原子間力の大部分が局所的であることに対応する。
  • 各階層レベルでアルファカルボン酸(α-カーボン)を集約ポイントとして用い、回転等長性を維持するとともに、マルチスケールのモチーフ検出を可能にする。
  • グローバルなフィンガープrintは、アルファカーボン特徴の平均化により形成され、その後2層の全結合層(250および150ユニット、ReLU活性化関数)を経て、単一の品質スコアを予測する。
  • ネットワークは、シーケンスアラインメントや外部特徴に依存せず、CASPデータセット上でGDT_TSを正例として、エンドツーエンドに学習される。

実験結果

リサーチクエスチョン

  • RQ1物理的エネルギー項を一切使用せず、原子座標のみに依存する深層学習モデルが、最先端のタンパク質モデル品質評価を達成できるか?
  • RQ2回転等長性は、タンパク質モデルにおける構造的特徴学習の一般化性と頑健性をどのように向上させるか?
  • RQ3教師なしで、局所的かつ階層的な畳み込みが、生物学的に意味のある構造モチーフをどの程度正しく捉えることができるか?
  • RQ4複数の配列アラインメントや進化的情報を取り入れる手法と比較して、完全に座標ベースのアプローチが優れているか?

主な発見

  • CASP12ステージ2では、ターゲットごとのスピアーマン相関係数が0.62を達成し、複数の配列アラインメントを用いた先行手法をすべて上回った。
  • CASP11ステージ2では、グローバルなスピアーマン相関係数が0.84を記録し、モデル全体の品質順位付けにおいて優れた性能を示した。
  • 主成分分析(PCA)の可視化により、学習されたフィンガープrintが、ファンデルワールス相互作用の頻度やアルファヘリックス含有量といった生物学的に意味のある特徴を符号化していることが示された。
  • ネットワークは、残基間相互作用頻度や二次構造組成といった構造的性質に基づいてモデルをクラスタリングできており、意味のある表現学習が実現していることを示している。
  • 物理的エネルギー関数やシーケンスアラインメントなどの外部データを一切使用せず、最先端の結果を達成した。
  • 多様なタンパク質ターゲットにわたり良好に一般化し、CASP11およびCASP12の両テストセットで高い性能を発揮した。これは、本手法の頑健性とスケーラビリティを確認するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。