Skip to main content
QUICK REVIEW

[論文レビュー] Accurate Protein Structure Prediction by Embeddings and Deep Learning Representations

Iddo Drori, Darshan Thaker|arXiv (Cornell University)|Nov 9, 2019
Protein Structure and Dynamics参考文献 12被引用数 6
ひとこと要約

本論文は、アミノ酸配列からバックボーン原子間の距離行列と二面角を埋め込み表現を用いて予測し、最適化により3次元座標を回復し、フルアトム構造を再構築する深層学習フレームワークを提示する。CASPT13で最先端の性能を達成し、CASPT12優勝手法を上回り、公開されたデータ、モデル、コードを併記している。

ABSTRACT

Proteins are the major building blocks of life, and actuators of almost all chemical and biophysical events in living organisms. Their native structures in turn enable their biological functions which have a fundamental role in drug design. This motivates predicting the structure of a protein from its sequence of amino acids, a fundamental problem in computational biology. In this work, we demonstrate state-of-the-art protein structure prediction (PSP) results using embeddings and deep learning models for prediction of backbone atom distance matrices and torsion angles. We recover 3D coordinates of backbone atoms and reconstruct full atom protein by optimization. We create a new gold standard dataset of proteins which is comprehensive and easy to use. Our dataset consists of amino acid sequences, Q8 secondary structures, position specific scoring matrices, multiple sequence alignment co-evolutionary features, backbone atom distance matrices, torsion angles, and 3D coordinates. We evaluate the quality of our structure prediction by RMSD on the latest Critical Assessment of Techniques for Protein Structure Prediction (CASP) test data and demonstrate competitive results with the winning teams and AlphaFold in CASP13 and supersede the results of the winning teams in CASP12. We make our data, models, and code publicly available.

研究の動機と目的

  • アミノ酸配列からタンパク質構造を高精度に予測する深層学習ベースの手法を開発すること。
  • トレーニングおよびPSPモデルの評価に用いる包括的かつアクセス可能なゴールドスタンダードデータセット(CUProtein)を構築すること。
  • 共進化的特徴、PSSM、複数アラインメントを統合したフレームワークを活用することで、既存手法を改善すること。
  • 距離行列と二面角の予測に続くエネルギーに基づく最適化により、高精度な3次元構造再構築を可能とすること。
  • 計算生物学分野における研究の障壁を低減するため、データ、モデル、コードを公開すること。

提案手法

  • 本手法は、アミノ酸配列、PSSM、複数アラインメント特徴量からバックボーン原子間距離行列と二面角を深層学習で予測する。
  • 幾何的および物理的エネルギー制約を最小化する非線形最適化問題を解くことで、バックボーンの3次元座標を再構築する。
  • ボンド、ラマチャンドラン、および二面角項を含むエネルギー最小化により、平均値のルックアップテーブルを用いて初期化したphi/psi角度を精緻化することで、フルアトム構造を生成する。
  • 予測された二面角が自然なタンパク質の角度の非対称的分布から大きく外れる場合、エナンチオマー反転処理を適用する。
  • ロタマー・ライブラリを用いて側鎖を追加し、反復的エネルギー最小化によりクラッシュを解消する。
  • 本フレームワークは、配列、二次構造、共進化的特徴、実験的に決定された3次元座標を備えた約75,000個のタンパク質からなる新規データセットで学習された。

実験結果

リサーチクエスチョン

  • RQ1進化的および配列特徴量で学習した深層学習モデルは、高精度にタンパク質バックボーン距離行列と二面角を予測できるか?
  • RQ2幾何最適化を用いて予測された距離行列と二面角から、信頼性高くバックボーン3次元座標を回復できるか?
  • RQ3エネルギー関数を最適化したバックボーン座標から、高精度なフルアトムタンパク質構造を再構築できるか?
  • RQ4本手法の性能は、AlphaFold やCASPT13優勝チームのような最先端手法と比較してどの程度か?
  • RQ5包括的かつオープンなデータセットの提供が、タンパク質構造予測研究における再現可能性とアクセス可能性をどの程度向上させるか?

主な発見

  • 本手法はCASPT13で優勝チームと同等の性能を達成し、選択ターゲットでの平均RMSDが1.60 Åに留まり、トップクラスの性能を示した。
  • CASPT12ターゲットでは、優勝チームの1.35 Åよりも優れた結果を達成し、平均RMSDが1.31 Åであった。
  • 挑戦的ターゲットT1003(CASPT13)では2.95 ÅのRMSDを達成し、AlphaFold A7Dモデルの2.12 Åを上回った。
  • 複数のCASPT13ターゲットで2 Å未満のRMSDを達成し、T0951では1.01 Å、T1006では0.58 Åを記録し、高精度であることが示された。
  • クラウドGPUインスタンスでの学習は約2日間を要し、推論(距離行列と二面角予測)は1タンパク質あたり数秒で完了した。
  • フルアトム再構築パイプライン(エネルギー最小化および側鎖配置含む)は、タンパク質の長さに応じて1タンパク質あたり数分程度で完了した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。