Skip to main content
QUICK REVIEW

[論文レビュー] The evaluation of protein folding rate constant is improved by predicting the folding kinetic order with a SVM-based method

Emidio Capriotti, Rita Casadio|ArXiv.org|Feb 13, 2006
Protein Structure and Dynamics被引用数 3
ひとこと要約

本研究では、SVMベースの手法(SVM-KO)を導入し、タンパク質の折りたたみ動力学的順序(2状態対多状態)を予測するとともに、折りたたみ速度定数の予測精度を向上させる。この手法は、2つの異なる回帰モデルに予測を分けることで、2状態と多状態の各動力学的クラスに分けて処理する。シーケンス長とコンタクトオーダーのみを用いて、2状態タンパク質では0.84の相関(SE = 0.90)、多状態タンパク質では0.79の相関を達成し、単一モデルの回帰法に比べ顕著に優れた性能を示した。

ABSTRACT

Protein folding is a problem of large interest since it concerns the mechanism by which the genetic information is translated into proteins with well defined three-dimensional (3D) structures and functions. Recently theoretical models have been developed to predict the protein folding rate considering the relationships of the process with tolopological parameters derived from the native (atomic-solved) protein structures. Previous works classified proteins in two different groups exhibiting either a single-exponential or a multi-exponential folding kinetics. It is well known that these two classes of proteins are related to different protein structural features. The increasing number of available experimental kinetic data allows the application to the problem of a machine learning approach, in order to predict the kinetic order of the folding process starting from the experimental data so far collected. This information can be used to improve the prediction of the folding rate. In this work first we describe a support vector machine-based method (SVM-KO) to predict for a given protein the kinetic order of the folding process. Using this method we can classify correctly 78% of the folding mechanisms over a set of 63 experimental data. Secondly we focus on the prediction of the logarithm of the folding rate. This value can be obtained as a linear regression task with a SVM-based method. In this paper we show that linear correlation of the predicted with experimental data can improve when the regression task is computed over two different sets, instead of one, each of them composed by the proteins with a correctly predicted two state or multistate kinetic order.

研究の動機と目的

  • 回帰モデルに動力学的順序分類を組み込むことで、タンパク質の折りたたみ速度定数の予測を改善すること。
  • 構造的パラメータのみを用いて、タンパク質が2状態または多状態のメカニズムで折りたたむかを予測する機械学習手法を開発すること。
  • 折りたたみ速度定数の予測を動力学的メカニズムごとに分離することで、実験データとの相関が向上するかどうかを評価すること。
  • コンタクトオーダーを用い、異なるシーケンス間隔のしきい値を変化させることで、局所的相互作用と非局所的相互作用の相対的な重要性を、折りたたみ動力学的特性の決定要因として評価すること。
  • 最小限の構造的入力からの折りたたみ動力学的予測のための一般化可能で、交差検証が可能なフレームワークを提供すること。

提案手法

  • 63個の実験的に特徴付けられた単ドメインタンパク質を用いて、シーケンス長とコンタクトオーダーを入力として、SVM分類器を訓練し、動力学的順序(2状態対多状態)を予測した。
  • 変動するカットオフ半径(最適化で9 Å)とシーケンス間隔のしきい値(最適化で≥6残基)を用いて、局所的相互作用と非局所的相互作用を区別するコンタクトオーダー(CO)を計算した。
  • SVM-KOモデルの堅牢性と一般化性能を確保するため、10分割交差検証を実施した。
  • 同じ入力特徴量を用いて、線形SVM回帰を適用し、折りたたみ速度定数の対数(log kf)を予測した。
  • 正しく予測された動力学的順序に基づいてデータセットを2つのサブセットに分割(2状態:34タンパク質、多状態:15タンパク質)し、それぞれのサブセットに対して別々の線形回帰を実行することで、予測精度を向上させた。
  • 性能評価には、相関係数(r)、標準誤差(SE)、マシューの相関係数(MCC)を用いた。

実験結果

リサーチクエスチョン

  • RQ1シーケンス長とコンタクトオーダーのみを用いて、機械学習モデルがタンパク質の2状態または多状態折りたたみメカニズムを正確に予測できるか。
  • RQ22状態タンパク質と多状態タンパク質のそれぞれに別々の予測モデル(1つずつ)を適用することで、単一モデルに比べて実験データとの相関が向上するか。
  • RQ3折りたたみ動力学的予測において、コンタクトオーダー計算の最適なカットオフ半径とシーケンス間隔のしきい値は何か。
  • RQ4局所的相互作用と非局所的相互作用の両方が、折りたたみ動力学的順序と速度定数の予測にどのように寄与するか。
  • RQ5動力学的順序の予測を組み込むことで、折りたたみ速度定数の推定精度がどの程度向上するか。

主な発見

  • SVM-KO手法は、78%のタンパク質を2状態または多状態の折りたたみメカニズムに正しく分類でき、マシューの相関係数は0.53であった。
  • 信頼性インデックスが3の予測に限定すると、正解率は85%に上昇し、データの75%の範囲で相関係数は0.66に達した。
  • 最適なコンタクトオーダー計算には、9 Åのカットオフ半径と、シーケンス間隔が≥6残基が最適であり、非局所的相互作用が折りたたみ動力学的特性の予測においてより予測能が高いことを示唆している。
  • 2状態タンパク質と多状態タンパク質のそれぞれに別々の線形回帰モデルを適用したところ、相関係数は2状態で0.84(SE = 0.90)、多状態で0.79(SE = 0.90)を達成し、単一モデルアプローチ(r = 0.65、SE = 1.35)を上回った。
  • 両サブセットの平均標準誤差は約0.90にまで低下し、動力学的メカニズムを分離することで、速度定数の予測精度が向上したことが示された。
  • 結果から、タンパク質の長さとコンタクトオーダーが折りたたみ速度の主要な決定要因であることが確認されたが、2状態と多状態の折りたたみメカニズムにおいて、その相対的寄与度は異なることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。