[論文レビュー] Statistical analysis of co-expression properties of sets of genes in the mouse brain
本論文は、マウス脳のAllen Gene Expression Atlasを用いて、遺伝子セット内の共発現パターンの統計的有意性を評価するためのグラフ理論的手法を提案する。288個の中毒関連遺伝子に適用した結果、全セットには顕著な共発現は認められなかったが、30個の遺伝子のサブセットはランダムなセットよりも顕著に高い共発現を示し、機能的クラスタリングの可能性を示唆する。
We propose a quantitative method to estimate the statistical properties of sets of genes for which expression data are available and co-registered to a reference atlas of the brain. It is based on graph-theoretic properties of co-expression coefficients between pairs of genes. We apply this method to mouse genes from the Allen Gene Expression Atlas. Co-expression patterns of a list of several hundreds of genes related to addiction are analyzed, using ISH data produced for the mouse brain at the Allen Institute. It appears that large subsets of this set of genes are much more highly co-expressed than expected by chance.
研究の動機と目的
- 脳全体の発現データを用いて、遺伝子セット内の共発現パターンの統計的有意性を評価する定量的手法を開発すること。
- NicSNPデータベースに登録された288個のニコチン依存関連遺伝子が、ランダムな遺伝子セットと比較して顕著な共発現を示すかどうかを評価すること。
- 大きな遺伝子リスト内に、生物学的に意味のある機能モジュールを表す可能性のある、より小さな高共発現サブセットを同定すること。
- モンテカルロシミュレーションと閾値を設定した共発現グラフを用いて、遺伝子共発現ネットワーク内の統計的に有意な連結成分を同定すること。
提案手法
- Allen Gene Expression Atlas (AGEA) から得たL²正規化済み遺伝子発現ベクトル間のコサイン類似度を用いて、共発現行列を構築する。ボクセル解像度は200 µmとする。
- 遺伝子ペア間のコサイン類似度係数をエッジとして用い、重み付きグラフとして共発現をモデル化する。
- 共発現グラフに閾値処理を施し、連結成分を同定し、異なる閾値におけるそのサイズ分布を分析する。
- 同じサイズのランダム遺伝子セットを用いたモンテカルロシミュレーションにより、比較のための経験的帰無分布を生成する。
- ブートストラップを用いて、ランダムおよび実際の遺伝子セットの共発現係数の経験的累積分布関数(ECDF)を推定する。
- グリーディアルゴリズムを用い、現在のセットに平均共発現度が最も高い遺伝子を逐次追加することで、初期リストを拡大し、高共発現サブセットを同定する。
実験結果
リサーチクエスチョン
- RQ1NicSNPデータベースに登録された288個の中毒関連遺伝子は、マウス脳において、偶然に期待されるよりも顕著に共発現していると評価できるか?
- RQ2これらの遺伝子のより小さなサブセットは、ランダムな遺伝子セットと比較して、統計的に顕著な共発現パターンを示すか?
- RQ3共発現ネットワークのグラフ理論的性質は、大きな条件関連遺伝子リスト内に生物学的に意味のある機能モジュールを検出できるか?
- RQ4異なる発現閾値における、実際の遺伝子セットとランダムな遺伝子セットの共発現係数の累積分布関数(CDF)は、どのように比較できるか?
主な発見
- 288個の中毒関連遺伝子の全セットは、高い共発現閾値における連結成分サイズの分布から、ランダムなセットと比較して統計的に有意な共発現を示さない。
- Gprasp1, Uchl1, Grin1, Ctsb, Gria2, Phyh, Snap25, Actr2, Gabarapl1, Calm1, Dlgh4, Syt1, Ppp1r9b, Cttn, Grik5, Gria3, Slc1a2, Ssbp4, Gria4, Hint1, Atrx, Per1, Slc1a1, Gabbr2, Chrm1, Gtpbp9, Cap1, Fbxw2, Mtch2, Socs5 の30遺伝子のサブセットは、偶然に期待されるよりも顕著に高い共発現を示す。
- 30遺伝子サブセットの共発現係数の累積分布関数(CDF)は、ランダムなセットと比較して早くかつ急激に上昇しており、高共発現ペアの割合が高いことを示している。
- 30遺伝子サブセットの閾値を設定した共発現グラフは、同じサイズのランダムセットと比較して、高い共発現閾値でもより大きく、より多数の連結成分を示している。
- 本手法は、大きな遺伝子リスト内に生物学的に妥当な、高共発現モジュールを効果的に同定でき、ニコチン依存関連遺伝子に機能的整合性があることを示唆する。
- 本アプローチは、全遺伝子リストに有意な共発現が認められない場合でも、小さな顕著な共発現モジュールを検出するのに有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。