Skip to main content
QUICK REVIEW

[论文解读] Statistical analysis of co-expression properties of sets of genes in the mouse brain

Pascal Grange, Partha P. Mitra|arXiv (Cornell University)|Nov 26, 2011
Bioinformatics and Genomic Networks参考文献 9被引用 4
一句话总结

该论文提出一种基于图论的方法,利用小鼠大脑中Allen基因表达图谱的余弦相似度,评估基因集合中共表达模式的统计显著性。将该方法应用于288个与成瘾相关的基因时,发现虽然整个基因集的共表达无显著异常,但其中30个基因的共表达水平显著高于随机集合,表明可能存在功能聚类。

ABSTRACT

We propose a quantitative method to estimate the statistical properties of sets of genes for which expression data are available and co-registered to a reference atlas of the brain. It is based on graph-theoretic properties of co-expression coefficients between pairs of genes. We apply this method to mouse genes from the Allen Gene Expression Atlas. Co-expression patterns of a list of several hundreds of genes related to addiction are analyzed, using ISH data produced for the mouse brain at the Allen Institute. It appears that large subsets of this set of genes are much more highly co-expressed than expected by chance.

研究动机与目标

  • 开发一种定量方法,利用全脑表达数据评估基因集合中共表达模式的统计显著性。
  • 评估来自NicSNP数据库的288个与尼古丁依赖相关基因的列表在小鼠大脑中是否表现出显著高于随机集合的共表达。
  • 在较大的基因列表中识别出更小的、高度共表达的子集,这些子集可能代表具有生物学意义的功能模块。
  • 使用蒙特卡洛模拟和阈值化共表达图,检测基因共表达网络中统计显著的连通分量。

提出的方法

  • 使用来自Allen基因表达图谱(AGEA)的L²归一化基因表达向量之间的余弦相似度构建共表达矩阵,空间分辨率为200 µm体素。
  • 将共表达建模为加权图,其中边代表基因对之间的余弦相似度系数。
  • 对共表达图应用阈值处理,以识别连通分量,并分析不同阈值下连通分量的大小分布。
  • 使用与目标基因集大小相同的随机基因集进行蒙特卡洛模拟,生成用于比较的经验零分布。
  • 采用自助法估计随机和真实基因集共表达系数的经验累积分布函数(ECDF)。
  • 使用贪心算法通过迭代添加与当前集合平均共表达度最高的基因,逐步扩展种子基因列表,以识别高度共表达的子集。

实验结果

研究问题

  • RQ1NicSNP数据库中的288个与成瘾相关的基因在小鼠大脑中是否表现出显著高于随机预期的共表达?
  • RQ2这些基因的更小子集是否表现出显著异常于随机基因集的共表达模式?
  • RQ3共表达网络的图论属性是否能够检测出大型疾病相关基因列表中的生物功能模块?
  • RQ4在不同表达阈值下,真实基因集与随机基因集的共表达系数累积分布函数如何比较?

主要发现

  • 在高共表达阈值下,全基因集(288个基因)的连通分量大小分布与随机集合相比未表现出统计显著的共表达,表明整体无异常。
  • 一个由30个基因组成的子集——Gprasp1, Uchl1, Grin1, Ctsb, Gria2, Phyh, Snap25, Actr2, Gabarapl1, Calm1, Dlgh4, Syt1, Ppp1r9b, Cttn, Grik5, Gria3, Slc1a2, Ssbp4, Gria4, Hint1, Atrx, Per1, Slc1a1, Gabbr2, Chrm1, Gtpbp9, Cap1, Fbxw2, Mtch2, Socs5——表现出显著高于随机预期的共表达水平。
  • 该30基因子集的共表达系数累积分布函数(CDF)上升更早且更迅速,表明高共表达配对的比例更高。
  • 该30基因子集的阈值化共表达图在高共表达阈值下显示出更大且数量更多的连通分量,优于同规模的随机集合。
  • 该方法成功识别出一个在生物学上合理、高度共表达的模块,表明尼古丁依赖相关基因中存在功能一致性。
  • 该方法在全基因集未显示显著共表达时,仍能有效检测出小型、异常的共表达模块。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。