Skip to main content
QUICK REVIEW

[論文レビュー] Mining Representative Unsubstituted Graph Patterns Using Prior Similarity Matrix

Wajdi Dhifli, Rabie Saidi|arXiv (Cornell University)|Mar 8, 2013
Bioinformatics and Genomic Networks参考文献 33被引用数 13
ひとこと要約

本稿では、変異行列(例:BLOSUM62)を活用して、タンパク質構造における頻出部分グラフから代表的な置換なしのグラフパターンを無教師で抽出する新規手法UnSubPattを提案する。構造的・進化的に異なるモチーフを選択することで、冗長性を低減し、パターン集合を著しく縮小するとともに、代表性と分類性能を向上させ、既存の教師あり手法を上回る精度を達成する。

ABSTRACT

One of the most powerful techniques to study protein structures is to look for recurrent fragments (also called substructures or spatial motifs), then use them as patterns to characterize the proteins under study. An emergent trend consists in parsing proteins three-dimensional (3D) structures into graphs of amino acids. Hence, the search of recurrent spatial motifs is formulated as a process of frequent subgraph discovery where each subgraph represents a spatial motif. In this scope, several efficient approaches for frequent subgraph discovery have been proposed in the literature. However, the set of discovered frequent subgraphs is too large to be efficiently analyzed and explored in any further process. In this paper, we propose a novel pattern selection approach that shrinks the large number of discovered frequent subgraphs by selecting the representative ones. Existing pattern selection approaches do not exploit the domain knowledge. Yet, in our approach we incorporate the evolutionary information of amino acids defined in the substitution matrices in order to select the representative subgraphs. We show the effectiveness of our approach on a number of real datasets. The results issued from our experiments show that our approach is able to considerably decrease the number of motifs while enhancing their interestingness.

研究の動機と目的

  • タンパク質3次元構造の頻出部分グラフ抽出における過剰な冗長性と計算負荷の問題に対処すること。
  • 代表的でコン pact なサブセットを選択することで、発見された部分グラフの解釈可能性と有用性を向上させること。
  • アミノ酸置換確率といったドメイン固有の知識をパターン選択プロセスに統合すること。
  • 分類にとどまらず、クラスタリング、インデキシング、可視化などに応用可能な、無教師で汎用的なフレームワークを構築すること。
  • 複雑な生物学的グラフから得られる大規模な部分グラフ集合に対する、効率的かつスケーラブルな解析を可能にすること。

提案手法

  • 本手法は、アミノ酸置換行列(例:BLOSUM62)から事前に導出した類似度行列を用い、部分グラフ内のノードラベル間の進化的類似度を定量化する。
  • 「置換不能なパターン」として、ユーザーが定めた閾値τに基づき、他のパターンに進化的に置換可能な部分グラフでないものを定義する。
  • グリーディ選択アルゴリズムを用い、すでに選択済みのパターンとの最小置換距離を最大化する部分グラフを逐次選択する。
  • 本手法はトランザクションレベルの共起関係ではなく、構造的・意味的類似度に焦点を当てたパターン空間で動作する。
  • スケーラビリティと並列処理を考慮して設計されており、部分グラフはサイズと順序ごとにグループ化され、分散処理が可能である。
  • 本手法は部分グラフの種別に依存せず、パス、木、クリーク、一般グラフなどに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1進化的な置換知識を組み込むことで、タンパク質構造抽出における代表的部分グラフの選択が改善されるか?
  • RQ2置換行列に基づく類似度測定と従来のトランザクション空間ベースの選択手法を比較した場合、パターンの質や分類精度にどのような差が生じるか?
  • RQ3提案手法は、生物学的・構造的代表性を維持または向上させつつ、頻出部分グラフ集合のサイズをどの程度縮小できるか?
  • RQ4大規模な部分グラフデータセットに適用した場合、本手法はスケーラブルで効率的か?
  • RQ5本手法の無教師特性は、分類にとどまらず、多様な後続タスク(例:クラスタリング、可視化)をサポートできるか?

主な発見

  • UnSubPattは、全テストデータセットでLEAP、gPLS、COM、LPGBCMPを上回る分類精度を達成し、競争力のある性能を示した。
  • 最小置換閾値τ = 30%の条件下で、UnSubPattはパターン数を削減しながらも、分類性能を維持または向上させた。
  • 本手法は効率的にスケーリング可能であり、τ = 30%で10万パターンを処理するのにわずか57秒で完了し、実行時間は線形に増加した。
  • 教師あり手法(LEAPやgPLS)を上回ったにもかかわらず、無教師であるという点を考慮すると、強力な一般化可能性を示した。
  • BLOSUM62置換行列の使用により、選択されたパターンの生物学的妥当性が顕著に向上した。
  • 本手法はさまざまな置換閾値に対して頑健であり、性能の低下が最小限に抑えられ、実行時間のスケーリングも一貫していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。