Skip to main content
QUICK REVIEW

[논문 리뷰] Protein Classification using Machine Learning and Statistical Techniques: A Comparative Analysis

C.L.P. Gupta, Anand Bihari|arXiv (Cornell University)|2019. 01. 18.
Machine Learning in Bioinformatics참고 문헌 36인용 수 7
한 줄 요약

이 연구는 유니프로트KB에서 추출한 4,368개의 인간 단백질 서열을 바탕으로, 물리화학적 및 구조적 특성 48개를 사용하여 단백질 기능 분류를 위한 일곱 가지 기계학습 및 통계 기법—CRT, QUEST, CHAID, C5.0, ANN, SVM, 베이지안—을 평가한다. C5.0가 가장 높은 정확도(86.49%)를 기록했으며, 특히 불균형한 클래스에서 정밀도, 재현율, F-측정치 측면에서 다른 모델들을 압도하여 고차원적이고 완전하지 않은 데이터에서 단백질 기능 예측에 가장 효과적인 모델로 입증되었다.

ABSTRACT

In recent era prediction of enzyme class from an unknown protein is one of the challenging tasks in bioinformatics. Day to day the number of proteins is increases as result the prediction of enzyme class gives a new opportunity to bioinformatics scholars. The prime objective of this article is to implement the machine learning classification technique for feature selection and predictions also find out an appropriate classification technique for function prediction. In this article the seven different classification technique like CRT, QUEST, CHAID, C5.0, ANN (Artificial Neural Network), SVM and Bayesian has been implemented on 4368 protein data that has been extracted from UniprotKB databank and categories into six different class. The proteins data is high dimensional sequence data and contain a maximum of 48 features.To manipulate the high dimensional sequential protein data with different classification technique, the SPSS has been used as an experimental tool. Different classification techniques give different results for every model and shows that the data are imbalanced for class C4, C5 and C6. The imbalanced data affect the performance of model. In these three classes the precision and recall value is very less or negligible. The experimental results highlight that the C5.0 classification technique accuracy is more suited for protein feature classification and predictions. The C5.0 classification technique gives 95.56% accuracy and also gives high precision and recall value. Finally, we conclude that the features that is selected can be used for function prediction.

연구 동기 및 목표

  • 일곱 가지 분류 기법—CRT, QUEST, CHAID, C5.0, ANN, SVM, 베이지안—이 단백질 기능 예측에서 어떻게 성능을 내는지 비교한다.
  • 고차원적 단백질 서열 데이터에서 효소 계열을 예측하는 데 가장 효과적인 분류 모델을 규명한다.
  • 데이터 불균형이 정밀도 및 재현율에 미치는 영향을 평가하며, 특히 정밀도와 재현율이 낮은 클래스 C4, C5, C6에 초점을 맞춘다.
  • C5.0의 특성 선택 기능을 활용하여 단백질 기능 예측에 가장 유용한 특성들을 특정한다.
  • 실제 유니프로트KB 데이터를 기반으로 계산 생물학 분야에서 기계학습 모델의 비교 기준을 제공한다.

제안 방법

  • 연구는 유니프로트KB에서 추출한 4,368개의 인간 단백질 서열을 사용하였으며, 각 서열은 48개의 물리화학적 및 구조적 특성으로 표현되었다.
  • 특성 선택 및 분류 분석은 SPSS를 활용하여 수행되었으며, 이는 CRT, QUEST, CHAID, C5.0, ANN, SVM, 베이지안 등 일곱 가지 모든 모델을 지원했다.
  • C5.0 알고리즘은 비선형적이고 고차원적인 데이터 및 결측치를 효과적으로 처리할 수 있는 능력을 특별히 평가하였다.
  • 성능 평가는 정확도, 정밀도, 재현율, F-측정치, MCC, 특이도 등 표준 지표를 사용하여 여섯 가지 효소 계열에서 평가되었다.
  • 분석에는 클래스별 및 총합 성능 평가가 포함되었으며, 불균형한 클래스(C4, C5, C6)에 특별한 주목을 기울였다.
  • 최종적으로 모든 클래스의 집계된 데이터를 바탕으로 전체 모델 성능을 평가하기 위해 종합적인 성능 비교를 수행하였다.

실험 결과

연구 질문

  • RQ1어느 기계학습 모델이 여섯 가지 효소 계열로 단백질 서열을 분류하는 데 가장 높은 정확도를 달성하는가?
  • RQ2C4, C5, C6 클래스의 데이터 불균형은 다양한 분류 모델의 정밀도 및 재현율에 어떤 영향을 미치는가?
  • RQ3SVM 및 ANN와 같은 다른 모델 대비 C5.0가 고차원적이고 완전하지 않은 단백질 서열 데이터를 효과적으로 처리할 수 있는가?
  • RQ4C5.0 모델이 특정한 특성 선택 기능을 통해 단백질 기능 예측에 가장 예측력 있는 특성들을 어떻게 규명하는가?
  • RQ5특성 선택을 앙상블 모델 또는 규칙 기반 모델과 조합함으로써 전체 예측 성능이 향상되는가?

주요 결과

  • C5.0는 전체 데이터셋에서 가장 높은 총합 정확도 86.49%를 기록하여 4,368개 단백질 서열 중 3,778개를 정확히 분류하였다.
  • C5.0는 모든 지표에서 뛰어난 성능를 보였으며, 정밀도, 재현율, F-측정치, MCC 모두에서 가장 높은 수준을 기록했고, 특히 불균형한 클래스에서 두드러진 성능를 보였다.
  • 클래스별 평가에서 C5.0는 95.56%의 정확도를 기록하여 CRT(66.96%), QUEST(61.63%), SVM(64.95%)를 크게 앞섰다.
  • 모델은 고차원 입력에도 불구하고 단지 2초의 계산 시간으로 실행되어 높은 효율성을 보였다.
  • C4, C5, C6 클래스는 모든 모델에서 정밀도와 재현율이 낮게 나타나 데이터 불균형이 단백질 분류에서 지속적인 과제임을 시사했다.
  • C5.0가 선별한 37개의 특성들은 기능 예측에 가장 관련성이 높은 특성들로 규명되었으며, 향후 모델 개발에 권장된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.