Skip to main content
QUICK REVIEW

[論文レビュー] A more appropriate Protein Classification using Data Mining

Muhammad Mahbubur Rahman, Arif Ul Alam|arXiv (Cornell University)|Nov 30, 2010
Machine Learning in Bioinformatics被引用数 3
ひとこと要約

本論文は、構造、配列、結合性、クラスターサイズ、相互作用性、系統的多様性の6つの主要なタンパク質属性を統合し、確率的類似度スコアを用いて階層的ツリー・モデルに組み込む、タンパク質分類のための新規なデータマイニング手法を提案する。PSIMAPとは異なり、スケールフリー構造を有するタンパク質の分類に失敗するが、本手法は、集約された確率的値を用いてボンド要因を計算することで、スケールフリー構造を有するタンパク質を含むすべてのタンパク質を正常にグループ化でき、最悪ケースにおいてO(n)の時間計算量を達成する。

ABSTRACT

Research in bioinformatics is a complex phenomenon as it overlaps two knowledge domains, namely, biological and computer sciences. This paper has tried to introduce an efficient data mining approach for classifying proteins into some useful groups by representing them in hierarchy tree structure. There are several techniques used to classify proteins but most of them had few drawbacks on their grouping. Among them the most efficient grouping technique is used by PSIMAP. Even though PSIMAP (Protein Structural Interactome Map) technique was successful to incorporate most of the protein but it fails to classify the scale free property proteins. Our technique overcomes this drawback and successfully maps all the protein in different groups, including the scale free property proteins failed to group by PSIMAP. Our approach selects the six major attributes of protein: a) Structure comparison b) Sequence Comparison c) Connectivity d) Cluster Index e) Interactivity f) Taxonomic to group the protein from the databank by generating a hierarchal tree structure. The proposed approach calculates the degree (probability) of similarity of each protein newly entered in the system against of existing proteins in the system by using probability theorem on each six properties of proteins.

研究の動機と目的

  • 既存のタンパク質分類手法、特にPSIMAPがスケールフリーのタンパク質をグループ化できないという限界を是正すること。
  • 複数のタンパク質属性を統合する統一されたフレームワークを構築すること。
  • 構造的・機能的・進化的性質を組み込むことで、階層的タンパク質グループ化を改善すること。
  • 最適化された時間計算量を用いて、大規模タンパク質データベースにおけるスケーラビリティと効率性を確保すること。

提案手法

  • 本手法は、構造、配列、結合性、クラスターサイズ、相互作用性、系統的多様性に基づき、各タンパク質に対して6つの個別の確率的スコアを計算する。
  • 各確率的スコアは、新しいタンパク質とシステム内に既存するタンパク質との類似度を測る確率的定理に基づいて算出される。
  • ボンド要因は、6つの個別の確率的値の合計として計算され、タンパク質間の全体的な類似度強度を表す。
  • 各新しいタンパク質のボンド要因をルートタンパク質と比較することで、再帰的に階層的ツリー構造を構築する。ルートタンパク質が存在しない場合は、最初のタンパク質がルートとして設定される。
  • アルゴリズムは動的に各タンパク質を確率的マッチが最も高いノードに割り当てることで、ツリー内での最適な配置を保証する。
  • 時間計算量は、最悪ケースでO(n)、最良ケースでO(l)と分析され、ここでnはタンパク質の数、lはツリーのレベルを表す。

実験結果

リサーチクエスチョン

  • RQ1既存の手法(例:PSIMAP)がグループ化に失敗するスケールフリーのタンパク質を、データマイニング的手法が効果的に分類できるか。
  • RQ2構造、配列、結合性、クラスターサイズ、相互作用性、系統的多様性といった複数のタンパク質属性を、単一の分類フレームワークに統合する方法は何か。
  • RQ3複数の属性にわたる確率的スコアを用いてタンパク質間の類似度を計算する最適な方法は何か。
  • RQ4提案されたアルゴリズムは、ツリー構造における新規タンパク質の動的かつ正確な階層的配置をどのように保証するか。
  • RQ5アルゴリズムの時間計算量は何か。また、大規模タンパク質データベースにおいてどのようにスケーリングするか。

主な発見

  • 提案手法は、PSIMAPがグループ化に失敗するスケールフリー構造を有するタンパク質を含め、すべてのタンパク質を正常に分類できた。
  • 6つのタンパク質属性を統合した単一の確率的ボンド要因の導入により、分類の正確性と頑健性が向上した。
  • アルゴリズムは最悪ケースでO(n)、最良ケースでO(l)の時間計算量を達成しており、大規模データベースへのスケーラビリティが示された。
  • ダミーデータを用いたシミュレーションにより、アルゴリズムが階層内で最も確率の高いノードにタンパク質を動的に割り当てられることを確認した。
  • スケールフリーのタンパク質を適切に分類できないというPSIMAPの主な限界を克服した点で、本手法はPSIMAPを上回った。
  • クラスターサイズ、結合性、相互作用性のための明確な関数の可用性に依存してアルゴリズムの成功が左右されるが、これらは現在のバイオインフォマティクス研究においてまだ開発途上の性質である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。