Skip to main content
QUICK REVIEW

[論文レビュー] Hypergraph and protein function prediction with gene expression data

Loc Tran|arXiv (Cornell University)|Dec 3, 2012
Bioinformatics and Genomic Networks被引用数 6
ひとこと要約

本稿では、遺伝子発現データを用いて、二項関係を超えたグループ単位の機能的関係を捉えることで、タンパク質機能予測を向上させるハイパーグラフベースの半教師あり学習手法を提案する。この手法は、正規化されていない、ランダムウォーク、対称正規化されたハイパーグラフラプラシアンの3種類を用い、Saccharomyces cerevisiae データにおいてベースラインのグラフベース手法よりも顕著に高い精度を達成した。

ABSTRACT

Most network-based protein (or gene) function prediction methods are based on the assumption that the labels of two adjacent proteins in the network are likely to be the same. However, assuming the pairwise relationship between proteins or genes is not complete, the information a group of genes that show very similar patterns of expression and tend to have similar functions (i.e. the functional modules) is missed. The natural way overcoming the information loss of the above assumption is to represent the gene expression data as the hypergraph. Thus, in this paper, the three un-normalized, random walk, and symmetric normalized hypergraph Laplacian based semi-supervised learning methods applied to hypergraph constructed from the gene expression data in order to predict the functions of yeast proteins are introduced. Experiment results show that the average accuracy performance measures of these three hypergraph Laplacian based semi-supervised learning methods are the same. However, their average accuracy performance measures of these three methods are much greater than the average accuracy performance measures of un-normalized graph Laplacian based semi-supervised learning method (i.e. the baseline method of this paper) applied to gene co-expression network created from the gene expression data.

研究の動機と目的

  • 複数の遺伝子が共発現パターンを示す機能モジュールを捉える際に、二項関係ネットワークモデルの限界を解消すること。
  • 標準的なグラフベースの半教師あり学習における情報損失を、ハイパーグラフによるグループ関係のモデル化によって克服すること。
  • 遺伝子発現データに対して、3つのハイパーグラフラプラシアンに基づく半教師あり学習手法を開発し、評価すること。
  • ハイパーグラフ手法が、従来のグラフラプラシアンベース手法に比べてタンパク質機能予測で優れた性能を示すことを実証すること。

提案手法

  • 共発現する遺伝子のグループを接続するハイパーエッジを有するハイパーグラフとして遺伝子発現データを表現し、それらが生物学的機能を共有する可能性が高いことを想定する。
  • 正規化されていない、ランダムウォーク、対称正規化された3つのハイパーグラフラプラシアンの変種を用い、ラベル伝搬をモデル化する。
  • ハイパーグラフ上で半教師あり学習を適用し、既知のラベルと共発現パターンに基づいてタンパク質機能を予測する。
  • 標準的な遺伝子共発現ネットワークを用いたベースラインを構築し、比較のための正規化されていないグラフラプラシアンを適用する。
  • 既知のタンパク質機能を有するSaccharomyces cerevisiae(イースト)の遺伝子発現データセットを用いてモデルを学習および評価する。
  • 複数回の実行および複数のデータセットにおける平均精度を主評価指標として用いる。

実験結果

リサーチクエスチョン

  • RQ1従来の二項関係グラフモデルに比べ、ハイパーグラフベースの学習はタンパク質機能予測を向上させることができるか?
  • RQ2正規化されていない、ランダムウォーク、対称正規化された3つのハイパーグラフラプラシアンの定式化は、性能においてどのように比較されるか?
  • RQ3グループ単位の共発現関係をモデル化することで、遺伝子ネットワークにおける機能モジュールの特定がより良くなるか?
  • RQ4ハイパーグラフ手法の性能向上は、グラフベースのベースラインと比較して統計的に有意であるか?
  • RQ5ハイパーグラフ構造は、半教師ありタンパク質機能予測におけるラベル伝搬精度にどのような影響を与えるか?

主な発見

  • 3つのハイパーグラフラプラシアンに基づく手法は、同一の平均精度を達成しており、異なる正規化スキームに対して一貫性があることが示された。
  • すべてのハイパーグラフベース手法が、ベースラインの正規化されていないグラフラプラシアン手法を顕著に上回った。
  • ハイパーグラフ手法は、共発現パターンによって定義される機能モジュールを効果的に捉えており、二項関係モデルでは捉え損ねた。
  • 結果から、遺伝子発現データにおけるグループ単位の関係が、正確な機能予測にとって重要であることが明らかになった。
  • 本研究は、遺伝子発現データにおける機能的関係をモデル化する際、標準的なグラフに比べてハイパーグラフがより適切な表現であるという実証的証拠を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。