Skip to main content
QUICK REVIEW

[论文解读] Modeling of microarray data with zippering

J. M. Deutsch, Shoudan Liang|ArXiv.org|Jun 17, 2004
Gene expression and cancer classification被引用 9
一句话总结

本文提出了一种基于物理原理的统计力学模型,用于寡核苷酸微阵列,该模型考虑了部分杂交(zippering)和溶液中靶标-靶标相互作用,显著提高了先前方法的预测精度。通过使用堆积自由能并采用完整的热力学处理,该模型在训练数据上实现了极佳的拟合效果,并在未见的测试数据上表现出优越的预测性能,尤其在低转录物浓度下表现更优。

ABSTRACT

The ability of oligonucleotide microarrays to measure gene expression has been hindered by an imperfect understanding of the relationship between input RNA concentrations and output signals. We argue that this relationship can be understood based on the underlying statistical mechanics of these devices. We present a model that includes the relevant interactions between the molecules. Our model for the first time accounts for partially zippered probe-target hybrids in a physically realistic manner, and also includes target-target binding in solution. Large segments of the target molecules are not bound to the probes, often in an asymmetric pattern, emphasizing the importance of modeling zippering properly. The resultant fit between the model and training data using optimized parameters is excellent, and it also does well at predicting test data.

研究动机与目标

  • 开发一种在物理上合理的微阵列杂交模型,以考虑部分探针-靶标结合(zippering)和靶标-靶标相互作用。
  • 改进从测量信号强度预测输入RNA浓度的能力,尤其针对低丰度转录物。
  • 通过从基本堆积自由能推导部分结合效应,减少对经验拟合参数的依赖。
  • 通过独立测试数据验证模型的预测能力,包括训练中排除的转录物。

提出的方法

  • 该模型使用统计力学描述探针-靶标杂交,将实验数据(Sugimoto et al.)提供的堆积自由能作为主要物理输入。
  • 将杂交过程视为热力学平衡,基于局部堆积自由能建模每个碱基对结合或未结合的概率。
  • 该模型同时包含特异性结合(探针-互补靶标)和非特异性结合(探针-非互补靶标)的贡献,后者以现象学方式处理。
  • 溶液中的靶标-靶标相互作用被纳入为有效靶标浓度的降低,其受RNA-RNA结合亲和力的调节。
  • 通过全局优化方法,基于2464个数据点最小化残差误差函数F,对54个参数(堆积自由能)进行优化。
  • 通过从训练中排除特定转录物并检验模型恢复其输入浓度的能力,评估预测性能。

实验结果

研究问题

  • RQ1一个在物理上一致的微阵列杂交模型,若包含部分zippering和靶标-靶标相互作用,是否能优于现有统计模型?
  • RQ2堆积自由能和热力学稳定性如何影响微阵列数据中观察到的非对称、非均匀的结合模式?
  • RQ3溶液中靶标-靶标相互作用在多大程度上影响测量信号强度和浓度预测的准确性?
  • RQ4与先前方法相比,基于基本物理原理的模型是否能减少对经验拟合参数的需求?

主要发现

  • 在训练数据上,该模型的残差误差F = 0.19,显著低于忽略靶标-靶标相互作用时的F = 0.27。
  • 在训练中排除的转录物上进行测试时,该模型能以高精度预测信号强度,其在形状和幅度上均优于Zhang et al.的PDNN模型。
  • 该模型成功以高保真度预测了三个排除转录物的输入浓度,如图3所示,证明了其强大的泛化能力。
  • 沿探针长度方向,未结合碱基的比例呈现非对称分布,表明存在非均匀的zippering,这是先前模型未能捕捉的特征。
  • 在优化过程中对探针序列进行随机化,使F值增加两倍以上,证实模型的成功源于序列特异的物理效应,而非过拟合。
  • 优化后的堆积自由能与未标记分子的实验测量值处于同一数量级,验证了模型的物理一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。