Skip to main content
QUICK REVIEW

[논문 리뷰] Natively unfolded proteins: scalar predictors

Antonio Deiana, Andrea Giansanti|arXiv (Cornell University)|2008. 06. 30.
Protein Structure and DynamicsBiochemistry, Genetics and Molecular Biology참고 문헌 42인용 수 1
한 줄 요약

이 연구는 천연적으로 펼쳐진 단백질을 식별하기 위해 스칼라 예측기—평균 포장(<P>), 평균 접촉 에너지(<Ec>), 그리고 새로운 gVSL2 기반 지표—를 도입하고 평가한다. 엄격한 동의어(SSI) 및 종합적(0) 점수 기반으로 이들 예측기를 조합함으로써, 이 방법은 79%의 민감도, 94%의 특이도, 오직 6%의 오류 예측을 기록하며, 생명의 세 영역에서 전장 유전체 수준의 펼쳐진 단백질 빈도에 대해 임계 지수 1.95 ± 0.21을 가진 스케일링 법칙을 드러낸다.

ABSTRACT

This work revisits ab-initio methods to identify natively unfolded proteins. Single predictors and combined score indexes are considered and their performance is critically evaluated against other methods already present in the literature. We consider mean packing (< P>), mean contact energy(< Ec>) and a new index of folding status, based on VSL2 (gV SL2), a predictor of single disordered amino acids. We use a new dataset made of 743 folded proteins and 81 natively unfolded proteins. Individual use of these predictors has a performance comparable or even better than other proposed methods: gV SL2 reaches a sensitivity (Sn) of 0.81, a specificity (Sp) of 0.89 and a level of false predictions (fp) of 0.11. The performance of these single predictors is significantly improved if used in combination. We introduce a strictly unanimous combination score SSU and a new score S0, combining 10 dichotomic predictors. The former score leaves some sequences undecided, whereas the latter classifies with no exceptions all the sequences in a dataset. Through the combined use of both scores we get: Sn=0.79, Sp=0.94 and fp=0.06, with less than 6 % of proteins left unpredicted. The combined use of SSU and S0 applied to the problem of finding the frequency of occurrence of natively unfolded proteins in genomes from Nature’s three kingdoms gives the following figures: the percentage of natively unfolded proteins predicted by SSU are 4.1 % for Bacteria, 1.0 % for Archaea and 20.0 % for Eukarya; comparable, but not coincident with similar previous determinations. Evidence is given of a scaling law relating the number of natively unfolded proteins with the total number of proteins in a genome; a first estimate of the critical exponent is 1.95 ± 0.21. 2

연구 동기 및 목표

  • 스칼라 예측기와 통합 점수 방법을 활용하여 천연적으로 펼쳐진 단백질의 ab-initio 예측을 향상시키기 위해.
  • gVSL2, <P>, <Ec>와 같은 단일 예측기의 성능을 기존 방법과 비교하기 위해.
  • 고감도를 유지하면서도 거짓 양성 예측을 최소화하는 통합 예측 프레임워크를 개발하기 위해.
  • 세 생명 영역(Bacteria, Archaea, Eukarya)에서 천연적으로 펼쳐진 단백질의 빈도를 추정하기 위해.
  • 전장 유전체 크기와 천연적으로 펼쳐진 단백질 수 사이의 스케일링 관계를 조사하기 위해.

제안 방법

  • 743개의 접힘 단백질과 81개의 천연적으로 펼쳐진 단백질로 구성된 데이터셋을 사용하여 스칼라 예측기를 학습하고 테스트한다.
  • gVSL2를 단일 아미노산의 비정상성 예측 기반으로 새로운 접힘 상태 지표로 활용한다.
  • 두 가지 통합 점수—SSI(엄격한 동의어), S0(종합적)—를 도입하여 10개의 이항 예측기를 통합한다.
  • SSI와 S0를 동시에 적용하여 단백질을 분류함으로써, 예측 완전성과 정확성 사이의 균형을 확보한다.
  • Nature의 세 영역에서의 전장 유전체 데이터를 분석하여 펼쳐진 단백질 빈도를 추정한다.
  • 전체 단백질 수와 천연적으로 펼쳐진 단백질 수 사이의 거듭제곱 법칙 모델을 적합하여 스케일링 지수를 결정한다.

실험 결과

연구 질문

  • RQ1gVSL2, <P>, <Ec>와 같은 개별 스칼라 예측기의 성능이 기존 방법과 비교해 천연적으로 펼쳐진 단백질을 식별하는 데 어떻게 다른가?
  • RQ2여러 스칼라 예측기를 조합함으로써 민감도와 특이도를 크게 향상시킬 수 있는가?
  • RQ3예측 완전성과 정확성 사이의 최적의 균형은 예측기 조합 시 어떻게 달성되는가?
  • RQ4Bacteria, Archaea, Eukarya에서 천연적으로 펼쳐진 단백질의 전장 유전체 빈도는 각각 얼마인가?
  • RQ5전체 단백질 수와 천연적으로 펼쳐진 단백질 수 사이에 스케일링 관계가 존재하는가?

주요 결과

  • gVSL2 예측기만으로도 81%의 민감도, 89%의 특이도, 오직 11%의 거짓 양성 비율을 기록한다.
  • SSI와 S0를 통합적으로 사용하면 79%의 민감도, 94%의 특이도, 오직 6%의 오류 예측을 기록하며, 6% 미만의 단백질이 결정되지 않은 상태로 남는다.
  • SSI 방법에 따르면 Bacteria에서는 4.1%의 단백질이 천연적으로 펼쳐진 것으로 예측되었고, Archaea에서는 1.0%, Eukarya에서는 20.0%였다.
  • 관측된 빈도는 이전 추정치와 유사하지만 동일하지 않으며, 이는 결과의 강건성과 일관성을 시사한다.
  • 임계 지수 1.95 ± 0.21을 가진 스케일링 법칙이 확인되었으며, 이는 전장 유전체 크기와 펼쳐진 단백질 수 사이의 거듭제곱 법칙 관계를 나타낸다.
  • SSI와 S0의 통합 프레임워크는 낮은 거짓 양성 예측을 유지하면서도 다양한 유전체에서 신뢰할 수 있고 확장 가능한 예측을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.