Skip to main content
QUICK REVIEW

[论文解读] Stochasticity or Noise in Biochemical Reactions

Zachary Fox, Brian Munsky|arXiv (Cornell University)|Aug 30, 2017
Gene Regulatory Network Analysis参考文献 52被引用 7
一句话总结

本文提出一种基于化学主方程(CME)和有限状态投影(FSP)的计算框架,用于建模生化反应中的随机性,特别是基因表达的随机性。该方法通过基于似然的推断,能够对单细胞、单分子数据(如smFISH测量结果)进行离散概率分布的精确拟合,即使在分布具有多峰或重尾等非高斯特征时,也能实现精确的参数识别。

ABSTRACT

Heterogeneity in gene expression across isogenic cell populations can give rise to phenotypic diversity, even when cells are in homogenous environments. This diversity arises from the discrete, stochastic nature of biochemical reactions, which naturally arise due to the very small numbers of genes, RNA, or protein molecules in single cells. Modern measurements of single biomolecules have created a vast wealth of information about the fluctuations of these molecules, but a quantitative understanding of these complex, stochastic systems requires precise computational tools. In this article, we present modern tools necessary to model variability in biological system and to compare model results to experimental data. We review the Chemical Master Equation and approaches to solve for probability distributions of discrete numbers of biomolecules. We discuss how to fit probability distributions to single-cell data using likelihood based approaches. Finally, we provide examples of fitting discrete stochastic models to single-molecule fluorescent in-situ hybridization data that quantifies RNA levels across populations of cells in bacteria and yeast.

研究动机与目标

  • 解决由于单个细胞中分子数量低而导致的生化反应内在噪声建模挑战。
  • 开发计算工具,弥合离散随机模型与实验单细胞数据之间的鸿沟,尤其针对低丰度分子。
  • 通过基于似然的参数拟合,实现实验模型与异质性单细胞数据之间的定量比较。
  • 展示在数据呈现非高斯特征(如多峰性或重尾)时,全概率建模相较于基于矩量的方法具有显著优势。
  • 提供一种框架,利用随机建模与实验数据识别基因表达网络中的调控机制。

提出的方法

  • 使用化学主方程(CME)表述基因表达动力学,描述离散分子计数概率分布随时间的演化。
  • 应用有限状态投影(FSP)方法,将无限维的CME截断为有限维常微分方程组,实现具有可控误差的数值求解。
  • 引入吸收态以量化FSP方法在任意有限时间内的近似误差,确保在截断状态空间内的保证精度。
  • 推导FSP计算得到的概率分布的似然函数,以实现与实验单细胞数据的统计拟合。
  • 采用基于似然的推断方法,将模型预测与细菌、酵母和人类细胞中RNA水平的实验smFISH数据相匹配。
  • 引入时变转移率(例如,动态磷酸化状态)以建模瞬态调控信号,如应激反应中的Hog1-p。

实验结果

研究问题

  • RQ1如何将基因表达的离散随机模型精确拟合到单细胞、单分子实验数据?
  • RQ2当数据呈现非高斯分布(如多峰或重尾分布)时,基于矩量的方法存在哪些局限性?
  • RQ3FSP方法在多大程度上能为低分子数量系统提供准确且计算可行的高维CME解?
  • RQ4将FSP近似误差纳入似然函数在多大程度上能提升模型识别与参数估计的性能?
  • RQ5生化反应中的随机性在何种方式下可导致同源、均质群体中的表型多样性?

主要发现

  • CME/FSP框架能够实现准确且计算可行的基因表达建模,具有保证的误差界,尤其适用于相互作用物种少于四个、总分子数低于约1000的系统。
  • 基于似然的拟合方法可将FSP计算得到的分布精确匹配到smFISH数据,即使在数据呈现复杂非高斯特征(如多峰或长尾)时,也能实现精确的参数估计。
  • 当数据为非高斯分布且样本量不足以满足中心极限定理时,基于矩量且假设高斯波动的方法可能无法识别出正确模型。
  • FSP方法成功捕捉了酵母中应激诱导基因激活的动力学,表明瞬态核内Hog1-p水平可调节活跃转录状态(S2、S3、S4)的稳定性。
  • 该模型表明,单分子事件(如磷酸化MAPK随机到达基因启动子)可在同源细胞中导致全或无的表型结果。
  • 该框架揭示,即使在受控环境中,同源群体中的表型多样性主要源于生化反应的离散性和随机性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。