[論文レビュー] Real-value and confidence prediction of protein backbone dihedral angles through a hybrid method of clustering and deep learning
本稿では、タンパク質骨格二面角のk-meansクラスタリングと深層畳み込みニューラルネットワークを組み合わせたハイブリッド手法RaptorX-Angleを提案する。この手法は、実数値のフィーとプシの角度とその予測信頼性を予測する。クラスタを二変量ボンメス分布としてモデル化し、予測ラベル確率を用いて重み付き混合分布を計算することで、最新の精度を達成し、推定誤差と実際の予測誤差の間に強い線形関係を示した。
Background. Protein dihedral angles provide a detailed description of protein local conformation. Predicted dihedral angles can be used to narrow down the conformational space of the whole polypeptide chain significantly, thus aiding protein tertiary structure prediction. However, direct angle prediction from sequence alone is challenging. Method. In this study, we present a novel method to predict real-valued angles by combining clustering and deep learning. That is, we first generate certain clusters of angles (each assigned a label) and then apply a deep residual neural network to predict the label posterior probability. Finally, we output real-valued prediction by a mixture of the clusters with their predicted probabilities. At the same time, we also estimate the bound of the prediction errors at each residue from the predicted label probabilities. Result. In this article, we present a novel method (named RaptorX-Angle) to predict real-valued angles by combining clustering and deep learning. Tested on a subset of PDB25 and the targets in the latest two Critical Assessment of protein Structure Prediction (CASP), our method outperforms the existing state-of-art method SPIDER2 in terms of Pearson Correlation Coefficient (PCC) and Mean Absolute Error (MAE). Our result also shows approximately linear relationship between the real prediction errors and our estimated bounds. That is, the real prediction error can be well approximated by our estimated bounds. Conclusions. Our study provides an alternative and more accurate prediction of dihedral angles, which may facilitate protein structure prediction and functional study.
研究の動機と目的
- アミノ酸配列から実数値のタンパク質骨格二面角を予測する精度を向上させること。
- 各リジドに対して予測信頼性の境界を推定する手法を開発し、下流の応用分野での信頼できる利用を可能にすること。
- 連続的な二面角を予測する課題に、クラスタリングによる離散的ラベル割り当て問題に変換することで対処すること。
- 限定的な数のクラスタ(20個)が、タンパク質構造におけるフィー/プシ角度の複雑な分布を効果的に表現できることを示すこと。
- タンパク質三次元構造予測および機能的解析に使用可能な、計算的に効率的で高精度なフレームワークを提供すること。
提案手法
- PDBの大きなサブセットからのフィー/プシ角度ペアに対してk-meansクラスタリングを適用し、20個の明確な構造的盆地を定義し、それぞれにラベルを割り当てる。
- 深層畳み込みニューラルネットワークが、配列および進化的特徴(PSSM)に基づいて、与えられたリジドの各クラスターラベルの事後確率を予測する。
- 実数値の二面角は、クラスタ平均の重み付き混合として推定され、重みは予測されたラベル確率である。
- 予測信頼性は、各クラスタの角度分布に適合された二変量ボンメス混合モデルから得られるクラスタ内標準偏差を用いて推定される。
- 1次元畳み込みニューラルネットワークとPSI-BLASTから得られるPSSM特徴を活用し、配列レベルの表現を抽出する。
- フレームワークはPDB25とCASPターゲットのサブセットで訓練および評価され、PCCとMAEを指標として性能を測定した。
実験結果
リサーチクエスチョン
- RQ1クラスタリングとディープラーニングのハイブリッドアプローチは、既存の手法と比較して、実数値の二面角予測精度を向上させることができるか?
- RQ2クラスタ化された盆地からの予測ラベル確率は、連続的で実数値の角度予測を効果的に生成するために使用できるか?
- RQ3推定された予測誤差境界と実際の予測誤差の間に、リジド全体で線形関係が成立するか?
- RQ4高い予測不確実性を示すことで、不規則または柔軟な領域を信頼性高く同定できるか?
- RQ5固定された20個のクラスタを使用することで、細かすぎるまたは粗すぎる離散化を用いる手法よりも十分な構造的情報を捉えることができるか?
主な発見
- RaptorX-Angleは、PDB25のサブセットおよびCASPターゲットを含むすべてのテストデータセットで、SPIDER2を上回るピアソン積率相関係数(PCC)を達成した。
- PDB25サブセットにおいて、フィー角について約0.5°、プシ角について約1.4°の平均絶対誤差(MAE)がSPIDER2より低減された。
- 推定された予測誤差境界と実際の予測誤差の間に強い近似的な線形関係が確認され、信頼性の高い信頼性推定の妥当性が裏付けられた。
- TS1267データセットでは、フィー角について0.15%、プシ角について1%の二値予測精度(90°以内の誤差)が向上した。
- 不規則な領域では、高い予測不確実性が観察され、これは大規模なクラスタ内標準偏差として示され、柔軟で動的である性質と整合的であった。
- バッチ処理において計算的に効率的であり、TS1267の全1267タンパク質の角度予測を1つのGPUで750秒で完了し、速度と精度の両面で他の手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。