Skip to main content
QUICK REVIEW

[論文レビュー] Protein Classification using Machine Learning and Statistical Techniques: A Comparative Analysis

C.L.P. Gupta, Anand Bihari|arXiv (Cornell University)|Jan 18, 2019
Machine Learning in Bioinformatics参考文献 36被引用数 7
ひとこと要約

本研究では、UniProtKBから抽出した4,368個のヒトタンパク質配列(48の特徴量に低次元化)を用いて、7つの機械学習および統計的手法(CRT、QUEST、CHAID、C5.0、ANN、SVM、ベイジアン)を用いたタンパク質機能分類を評価した。C5.0が最も高い正答率(86.49%)を達成し、特に不均衡なクラスにおいても適合率、再現率、F値で他を上回り、次元が高く欠損値を含むデータに対して効果的に機能するモデルとして、タンパク質機能予測の最良の手法であることが示された。

ABSTRACT

In recent era prediction of enzyme class from an unknown protein is one of the challenging tasks in bioinformatics. Day to day the number of proteins is increases as result the prediction of enzyme class gives a new opportunity to bioinformatics scholars. The prime objective of this article is to implement the machine learning classification technique for feature selection and predictions also find out an appropriate classification technique for function prediction. In this article the seven different classification technique like CRT, QUEST, CHAID, C5.0, ANN (Artificial Neural Network), SVM and Bayesian has been implemented on 4368 protein data that has been extracted from UniprotKB databank and categories into six different class. The proteins data is high dimensional sequence data and contain a maximum of 48 features.To manipulate the high dimensional sequential protein data with different classification technique, the SPSS has been used as an experimental tool. Different classification techniques give different results for every model and shows that the data are imbalanced for class C4, C5 and C6. The imbalanced data affect the performance of model. In these three classes the precision and recall value is very less or negligible. The experimental results highlight that the C5.0 classification technique accuracy is more suited for protein feature classification and predictions. The C5.0 classification technique gives 95.56% accuracy and also gives high precision and recall value. Finally, we conclude that the features that is selected can be used for function prediction.

研究の動機と目的

  • 6つの酵素クラスに分類するタンパク質機能予測における7つの分類手法(CRT、QUEST、CHAID、C5.0、ANN、SVM、ベイジアン)の性能を比較すること。
  • 高次元のタンパク質配列データからの酵素クラス予測に最も効果的な分類モデルを特定すること。
  • C4、C5、C6クラスに顕著なデータの不均衡が生じる中で、その影響がモデルの性能(適合率・再現率)に与える影響を評価すること。
  • C5.0の特徴量選択機能を活用し、タンパク質機能予測に最も有用な特徴量を同定すること。
  • 実世界のUniProtKBデータを用いた計算生物学分野における機械学習モデルの性能を比較する基準を提供すること。

提案手法

  • 本研究では、UniProtKBから抽出した4,368個のヒトタンパク質配列を用い、それぞれが48の物理的・化学的および構造的特徴量で表現された。
  • 特徴量選択と分類は、CRT、QUEST、CHAID、C5.0、ANN、SVM、ベイジアンの全7つのモデルをサポートするSPSSを用いて実施した。
  • C5.0アルゴリズムは、非線形かつ高次元のデータおよび欠損値の処理能力について特に評価された。
  • 性能評価には、正答率、適合率、再現率、F値、MCC、特異度の標準指標を用い、6つの酵素クラス全体で評価した。
  • 不均衡なクラス(C4、C5、C6)に特に注目し、クラスごとの評価と全体評価を併用した。
  • 最終的な全般的なモデル比較は、全クラスの集計データを用いて、全体の分類性能を評価する目的で実施した。

実験結果

リサーチクエスチョン

  • RQ1どの機械学習モデルが6つの酵素クラスに分類するタンパク質配列予測において最も高い正答率を達成するか?
  • RQ2C4、C5、C6クラスにおけるデータの不均衡が、異なる分類モデルの適合率および再現率に与える影響は何か?
  • RQ3SVM や ANN と比較して、C5.0 は高次元かつ欠損値を含むタンパク質配列データを効果的に処理できるか?
  • RQ4C5.0モデルが同定した特徴量の中で、タンパク質機能予測に最も予測価値があるのはどれか?
  • RQ5特徴量選択をアンサンブルモデルやルールベースモデルと組み合わせることで、全体の予測性能が向上するか?

主な発見

  • C5.0は全データセットで最も高い全体正答率86.49%(4,368個中3,778個が正しく分類)を達成した。
  • C5.0は、適合率、再現率、F値、MCCの全指標で優れた性能を示し、特に不均衡なクラスにおいて顕著に優位であった。
  • クラスごとの評価ではC5.0が95.56%の正答率を達成し、CRT(66.96%)、QUEST(61.63%)、SVM(64.95%)を大きく上回った。
  • 計算時間はわずか2秒で、高次元入力にもかかわらず高い効率性を示した。
  • C4、C5、C6クラスでは、すべてのモデルで適合率・再現率が低く、データの不均衡が依然としてタンパク質分類の課題として残っていることが明らかになった。
  • C5.0が選択した37の特徴量は、機能予測に最も関連性が高く、今後のモデル構築に推奨される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。