Skip to main content
QUICK REVIEW

[論文レビュー] Differential gene co-expression networks via Bayesian biclustering models

Chuan Gao, Shiwen Zhao|arXiv (Cornell University)|Nov 7, 2014
Gene expression and cancer classification参考文献 5被引用数 7
ひとこと要約

本論文では、サンプルのサブセットにおける遺伝子発現データのスパースかつ過剰な表現を同時に推定することで、差分遺伝子共発現ネットワークを同定するベイジアンバイクラスタリングモデル、BicMixを提案する。スパース性を促進する事前分布と不確実性の定量化を用いて遺伝子およびサンプルの共調節をモデル化することで、従来の手法に比べて潜在構造の回復性能が向上し、乳がんデータにおいて生物学的に意味のあるER状態特異的共発現ネットワークを同定した。

ABSTRACT

Identifying latent structure in large data matrices is essential for exploring biological processes. Here, we consider recovering gene co-expression networks from gene expression data, where each network encodes relationships between genes that are locally co-regulated by shared biological mechanisms. To do this, we develop a Bayesian statistical model for biclustering to infer subsets of co-regulated genes whose covariation may be observed in only a subset of the samples. Our biclustering method, BicMix, has desirable properties, including allowing overcomplete representations of the data, computational tractability, and jointly modeling unknown confounders and biological signals. Compared with related biclustering methods, BicMix recovers latent structure with higher precision across diverse simulation scenarios. Further, we develop a method to recover gene co-expression networks from the estimated sparse biclustering matrices. We apply BicMix to breast cancer gene expression data and recover a gene co-expression network that is differential across ER+ and ER- samples.

研究の動機と目的

  • 不連続な遺伝子クラスタリング手法の限界を克服し、柔軟な統計モデルによって非不連続で重複する遺伝子モジュールを可能にすること。
  • すべてのサンプルではなくサブセットでのみ共変動が生じる遺伝子発現データにおける潜在的共調節パターンを回復すること。
  • 計算的実行可能性を確保しつつ、未知の交絡要因と生物学的信号を同時にモデル化するスパースかつ過剰な表現を用いること。
  • ER陽性およびER陰性の乳がん亜型のような条件下特異的な調節メカニズムを反映する差分遺伝子共発現ネットワークを構築すること。

提案手法

  • BicMixは、スパース性を促進する事前分布を両方に適用することで、遺伝子発現行列をスパースなローディング行列と要因行列に分解するベイジアン階層モデルを採用する。
  • 変分期待最大化(VEM)アルゴリズムを用いて、要因負荷、潜在要因、残差ノイズを同時に推定し、不確実性の定量化を可能にする。
  • 潜在要因数 $K$ をサンプル数 $n$ を超えるようにすることで、過剰表現を組み込み、小さな生物学的関連性のある共調節パターンへの感受性を高める。
  • 推定された要因共分散と残差分散から精度行列を構築し、遺伝子単位の偏相関を計算することで、ネットワーク推定を可能にする。
  • 信頼性の高い再現性のある共発現ネットワークを構築するために、エッジ存在確率が 0.8 以上の閾値と、$\geq$ 再実行回数にわたって出現するエッジを用いたコンセンサスフィルタリングを適用する。
  • 生物学的条件下での非ゼロ要因値に対する統計的仮説検定(例:ウィルコクソンランク和検定)を用いて、サブセット特異的および差分バイクラスタを同定するための新規アルゴリズムを提案する。

実験結果

リサーチクエスチョン

  • RQ1スパースかつ過剰な表現を組み込んだベイジアンバイクラスタリングモデルは、高次元で $p \gg n$ の遺伝子発現データから、重複する条件特異的遺伝子共発現モジュールを効果的に回復できるか?
  • RQ2過剰でスパースな表現の導入により、従来のバイクラスタリングおよび要因モデルに比べて、潜在構造回復の精度がどの程度向上するか?
  • RQ3BicMixは、ER陽性およびER陰性の乳がん亜型のようながん亜型において、生物学的に意味のある差分共発現ネットワークをどの程度検出できるか?
  • RQ4交絡要因と生物学的信号の共同モデル化は、推定された遺伝子ネットワークのロバストネスと解釈可能性をどの程度向上させるか?
  • RQ5スパース性を促進する事前分布は、サンプル特異的な共変動を示す小さな生物学的関連性のある遺伝子クラスタの回復にどのような影響を及えるか?

主な発見

  • BicMixは、Fabia、Plaid、CC、Bimax、Spectral biclusteringといった競合手法に比べ、多様なシミュレーション状況において真の潜在構造をより高い精度で回復した。
  • 密度の高い成分を含むシミュレーションでは、BicMixはシミュレートされたデータにおける非ゼロ要素の正しい数を的確に回復し、Fabia-truthおよび他の手法を上回った。
  • 交絡要因を含むSim2では、5つの主成分を補正した後も、BicMixは高い精度を維持し、隠れた交絡要因に対して強いロバストネスを示した。
  • 本手法は、乳がんデータにおいてER状態特異的生物学的機能に有意に富んだ差分遺伝子共発現ネットワークを同定した。
  • コンセンサスフィルタリング($\geq$ 50%の実行回数でエッジが出現)により構築された最終ネットワークには128遺伝子と207エッジが含まれ、エッジの再現性が高く、統計的有意性も強く(差分成分のp < 1e-10)。
  • アルゴリズムは、サブセット特異的および差分バイクラスタを効果的に抽出でき、後者はER陽性とER陰性サンプル間の差分調節の強い統計的証拠を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。