Skip to main content
QUICK REVIEW

[論文レビュー] Large-scale reverse engineering by the Lasso

Mika Gustafsson, Michael Hörnquist|ArXiv.org|Mar 11, 2004
Machine Learning and Algorithms参考文献 8被引用数 14
ひとこと要約

この論文は、6,178個のユーラシア酵母遺伝子の時系列マイクロアレイデータから、Lasso法を用いて大規模な遺伝子調節ネットワークを逆解析する。L1正則化によるスパarsityの強制により、スパースで生物学的に意味のあるネットワークが同定され、出次数分布が広がっており、特に最も高い次数を持つ遺伝子に転写因子が顕著に過剰に存在する。これは推定の生物学的妥当性を示す証拠である。

ABSTRACT

We perform a reverse engineering from the ``extended Spellman data'', consisting of 6178 mRNA levels measured by microarrays at 73 instances in four time series during the cell cycle of the yeast Saccharomyces cerevisae. By assuming a linear model of the genetic regulatory network, and imposing an extra constraint (the Lasso), we obtain a unique inference of coupling parameters. These parameters are transfered into an adjacent matrix, which is analyzed with respect to topological properties and biological relevance. We find a very broad distribution of outdegrees in the network, compatible with earlier findings for biological systems and totally incompatible with a random graph, and also indications of modules in the network. Finally, we show there is an excess of genes coding for transcription factors among the genes of highest outdegrees, a fact which indicates that our approach has biological relevance.

研究の動機と目的

  • シスチルレジオネイチャー・セレウスの時系列mRNA発現データから大規模な遺伝子調節ネットワークを推定すること。
  • 高次元の遺伝子発現データの不定性を、正則化された統計的手法を用いて解決すること。
  • トポロジー的性質と転写因子の過剰蓄積を分析することで、推定されたネットワークの生物学的関連性を評価すること。
  • Lasso正則化が大規模ネットワーク推定に適した一意でスパースな解をもたらすことを示すこと。

提案手法

  • 各遺伝子の発現ダイナミクスが他の遺伝子発現の重み付き和で記述される線形連続モデルを用いる。
  • Lasso(最小絶対値収縮および選択作用素)を適用し、残差平方和を最小化するとともに、係数にL1ノルム制約を課す。
  • L1制約によりスパarsityが誘発され、ノイズを除去し、最も関連性の高い調節的相互作用のみが選択される。
  • 拡張されたスプリルマンデータセット(4つの細胞周期系列における73時間点)の欠損値は、k=15のk近傍法を用いて補完される。
  • 解析前にデータを平均0、分散1に中心化および正規化する。
  • 推定された重み行列を隣接行列に変換し、出次数分布やネットワークモジュールなどのトポロジー的特徴を検討する。

実験結果

リサーチクエスチョン

  • RQ1Lasso法は、高次元で時系列的なマイクロアレイデータから、スパースで大規模な遺伝子調節ネットワークを効果的に推定できるか?
  • RQ2得られたネットワークは、既知の生物学的調節ネットワークと整合するトポロジー的性質を示すか?
  • RQ3高い出次数を持つ遺伝子が、既知の転写因子で過剰に蓄積されているか?これは推定の生物学的関連性を示唆する。
  • RQ4特に高い次数を持つ遺伝子に転写因子が過剰に存在している現象は、統計的に有意か?

主な発見

  • 推定されたネットワークは広い出次数分布を示しており、少数の遺伝子が多数の他の遺伝子を調節していることを示し、これはランダムグラフモデルとは矛盾する。
  • 出次数149を示す遺伝子RRN5は、RNAポリメラーゼIによるrDNA転写に関与し、生存に不可欠である。
  • 出次数53および51を示す遺伝子YHL026CおよびYJR079Wは、転写因子として知られていないが、その機能は未同定のままである。
  • 上位2,000個の最も高い接続度を持つ遺伝子において、転写因子の過剰蓄積が統計的に有意であり、Zスコアは4.6であった。
  • 高出次数遺伝子における転写因子の累積的過剰蓄積は、1標準偏差を超えており、上位737遺伝子で4.8、上位1,000で3.2、上位2,000で4.6であった。これは非ランダムな分布を示している。
  • 結果から、線形モデルとトランスクリプトームデータのみを用いても、Lassoベースの推定が生物学的に意味のある調節的関係を捉えている可能性が示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。