Skip to main content
QUICK REVIEW

[논문 리뷰] The evaluation of protein folding rate constant is improved by predicting the folding kinetic order with a SVM-based method

Emidio Capriotti, Rita Casadio|ArXiv.org|2006. 02. 13.
Protein Structure and Dynamics인용 수 3
한 줄 요약

이 연구는 단백질 접힘 동역학적 순서(이상태 vs. 다중상태)를 예측하는 SVM 기반 방법(SVM-KO)을 소개하며, 접힘 속도 상수 예측을 향상시키기 위해 각 동역학적 유형에 맞는 두 개의 별도 회귀 모델로 예측을 분리한다. 시퀀스 길이와 접촉 순서만을 사용하여, 이 방법은 이중상태 단백질에 대해 0.84의 상관계수(SE = 0.90)와 다중상태 단백질에 대해 0.79의 상관계수를 달성하며, 단일 모델 회귀보다 유의하게 뛰어난 성능을 보인다.

ABSTRACT

Protein folding is a problem of large interest since it concerns the mechanism by which the genetic information is translated into proteins with well defined three-dimensional (3D) structures and functions. Recently theoretical models have been developed to predict the protein folding rate considering the relationships of the process with tolopological parameters derived from the native (atomic-solved) protein structures. Previous works classified proteins in two different groups exhibiting either a single-exponential or a multi-exponential folding kinetics. It is well known that these two classes of proteins are related to different protein structural features. The increasing number of available experimental kinetic data allows the application to the problem of a machine learning approach, in order to predict the kinetic order of the folding process starting from the experimental data so far collected. This information can be used to improve the prediction of the folding rate. In this work first we describe a support vector machine-based method (SVM-KO) to predict for a given protein the kinetic order of the folding process. Using this method we can classify correctly 78% of the folding mechanisms over a set of 63 experimental data. Secondly we focus on the prediction of the logarithm of the folding rate. This value can be obtained as a linear regression task with a SVM-based method. In this paper we show that linear correlation of the predicted with experimental data can improve when the regression task is computed over two different sets, instead of one, each of them composed by the proteins with a correctly predicted two state or multistate kinetic order.

연구 동기 및 목표

  • 접힘 동역학적 순서 분류를 회귀 모델에 통합하여 단백질 접힘 속도 상수 예측 성능을 향상시키는 것.
  • 구조적 파rameter만을 사용하여 단백질이 이중상태 또는 다중상태 메커니즘을 통해 접히는지 예측하는 기계학습 방법을 개발하는 것.
  • 접힘 속도 예측을 동역학적 메커니즘에 따라 분리함으로써 실험 데이터와의 상관계수 향상 여부를 평가하는 것.
  • 접촉 순서를 다양한 시퀀스 간격 임계값을 사용하여 계산함으로써 국소적 상호작용과 비국소적 상호작용이 접힘 동역학에 미치는 상대적 중요도를 평가하는 것.
  • 최소한의 구조적 입력 자료로부터 일반화 가능하고 교차검증이 가능한 접힘 동역학 예측 프레임워크를 제공하는 것.

제안 방법

  • 63개의 실험적으로 특성화된 단일도메인 단백질을 대상으로 시퀀스 길이와 접촉 순서를 사용하여 SVM 분류기를 훈련하여 접힘 동역학적 순서(이중상태 또는 다중상태)를 예측한다.
  • 접촉 순서(CO)를 계산하기 위해 가변적인 컷오프 반경(최적화된 값: 9 Å)과 시퀀스 간격 임계값(최적화된 값: ≥6 개 아미노산)을 사용하여 국소적 상호작용과 비국소적 상호작용을 구분한다.
  • SVM-KO 모델의 강건성과 일반화 능력을 확보하기 위해 10중 교차검증을 수행한다.
  • 동일한 입력 특징을 사용하여 접힘 속도의 로그(log kf)를 예측하기 위해 선형 SVM 회귀를 적용한다.
  • 예측된 동역학적 순서가 올바르게 분류된 데이터셋을 기반으로 두 개의 하위집합(34개의 이중상태 단백질, 15개의 다중상태 단백질)으로 분할한 후, 각 하위집합에 대해 별도의 선형 회귀 분석을 수행함으로써 성능을 향상시킨다.
  • 상관계수(r), 표준오차(SE), 매튜스 상관계수(MCC)를 사용하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1시퀀스 길이와 접촉 순서만을 사용하여 기계학습 모델이 단백질이 이중상태 또는 다중상태 접힘 메커니즘을 따르는지를 정확하게 예측할 수 있는가?
  • RQ2이중상태 단백질과 다중상태 단백질에 대해 별도의 예측 모델(각각 하나의 모델)을 사용하는 것이 단일 모델 대비 실험 데이터와의 상관계수 향상에 기여하는가?
  • RQ3접힘 동역학 예측을 위한 접촉 순서 계산에서 최적의 컷오프 반경과 시퀀스 간격 임계값은 무엇인가?
  • RQ4국소적 상호작용과 비국소적 상호작용은 접힘 동역학적 순서 및 속도 상수 예측에 어떻게 영향을 미치는가?
  • RQ5접힘 동역학적 순서 예측을 포함함으로써 접힘 속도 상수 추정의 정확도 향상 정도는 어느 정도인가?

주요 결과

  • SVM-KO 방법은 78%의 단백질을 이중상태 또는 다중상태 접힘 메커니즘으로 정확히 분류하였으며, 매튜스 상관계수는 0.53이었다.
  • 신뢰도 지수 3 이상의 예측에 국한할 경우 정확도는 85%로 상승하고, 전체 데이터셋의 75%에서 상관계수는 0.66으로 향상되었다.
  • 최적의 접촉 순서 계산은 9 Å의 컷오프 반경과 시퀀스 간격 ≥6을 사용하였으며, 이는 비국소적 상호작용이 접힘 동역학 예측에 더 유의미한 영향을 미친다는 것을 시사한다.
  • 이중상태 단백질과 다중상태 단백질에 대해 별도의 선형 회귀 모델을 적용한 결과, 각각 상관계수 0.84(SE = 0.90)과 0.79(SE = 0.90)를 기록하였으며, 이는 단일 모델 접근 방식(r = 0.65, SE = 1.35)보다 뛰어난 성능을 보였다.
  • 두 하위집합의 평균 표준오차는 약 0.90으로 감소하여, 동역학적 메커니즘을 분리함으로써 속도 예측의 정밀도가 향상됨을 나타낸다.
  • 결과는 단백질 길이와 접촉 순서가 접힘 속도의 주요 결정요소임을 확인하며, 이들의 상대적 기여도는 이중상태와 다중상태 접힘 메커니즘 간에 다름을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.