Skip to main content
QUICK REVIEW

[论文解读] Scaling up Continuous-Time Markov Chains Helps Resolve Underspecification

Alkis Gotovos, Rebekka Burkholz|arXiv (Cornell University)|Jul 6, 2021
Gene expression and cancer classification被引用 7
一句话总结

本文提出将连续时间马尔可夫链(CTMC)扩展至大规模场景,以解决从横断面生物医学数据中学习时间有序过程时存在的欠定问题。通过引入额外的独立项目作为“背景时钟”,该方法提升了时间顺序推断的准确性,并实现了可扩展的似然最大化,使模型能高效处理数百个项目的场景——在真实TCGA数据上构建出稳健且可复现的癌症进展模型,而此前的结果可能是欠定问题导致的伪影。

ABSTRACT

Modeling the time evolution of discrete sets of items (e.g., genetic mutations) is a fundamental problem in many biomedical applications. We approach this problem through the lens of continuous-time Markov chains, and show that the resulting learning task is generally underspecified in the usual setting of cross-sectional data. We explore a perhaps surprising remedy: including a number of additional independent items can help determine time order, and hence resolve underspecification. This is in sharp contrast to the common practice of limiting the analysis to a small subset of relevant items, which is followed largely due to poor scaling of existing methods. To put our theoretical insight into practice, we develop an approximate likelihood maximization method for learning continuous-time Markov chains, which can scale to hundreds of items and is orders of magnitude faster than previous methods. We demonstrate the effectiveness of our approach on synthetic and real cancer data.

研究动机与目标

  • 解决从生物医学应用的横断面数据中学习连续时间马尔可夫链时存在的根本性欠定问题。
  • 证明引入额外的、看似无关的项目可通过充当背景时钟来缓解时间顺序的模糊性,从而实现时间估计。
  • 开发一种可扩展的似然最大化方法,克服先前方法在指数级计算复杂度方面的限制。
  • 在合成数据和真实癌症基因组数据上验证该方法,表明先前结果可能是欠定问题导致的伪影。
  • 提供一种稳健的框架,用于学习时间有序的生物过程,特别是在癌症进展建模方面。

提出的方法

  • 提出一种参数化CTMC模型,其生成矩阵被约束为仅允许通过增加一个项目来实现状态转移,以反映不可逆的累积过程(如基因改变)。
  • 引入参数矩阵 Θ ∈ ℝⁿˣⁿ 来建模转移速率,其结构设计支持高效计算与可扩展性。
  • 开发一种基于快速梯度近似的近似似然最大化方法,将计算成本从指数级降低至近线性规模。
  • 将每个样本中独立项目的数量作为时间的代理变量,即使在无显式时间标签的情况下也能实现时间顺序的估计。
  • 从学习到的模型中采样边缘序列,以推断某一事件先于另一事件发生的概率,从而实现对事件对之间时间顺序的推断。
  • 将该方法应用于包含 n=410 个项目的实际TCGA胶质母细胞瘤数据,结果显示模型在鲁棒性和与生物证据的一致性方面均有提升。

实验结果

研究问题

  • RQ1在从横断面数据学习CTMC时,引入额外的独立项目是否有助于缓解时间顺序的欠定问题?
  • RQ2为何先前在小规模项目子集上构建的CTMC模型会产生不可靠或不一致的时间顺序推断?
  • RQ3如何在不引发指数级计算成本的前提下,将CTMC中的似然最大化扩展至数百个项目?
  • RQ4在癌症进展模型中观察到的时间顺序关系在多大程度上依赖于子集选择和优化设置?
  • RQ5来自独立项目的背景时钟效应是否能提升推断出的生物时间顺序的稳健性与可复现性?

主要发现

  • 与Schill等人(2019)的最先进方法相比,该方法在 n=20 个项目的问题上运行速度提升了近1000倍,运行时间从121分钟缩短至8秒。
  • 该方法可高效扩展至 n=100 个项目,耗时33分钟43秒,使大规模基因组改变集合的分析成为可能。
  • 对于EGFR和PDGFRA,该方法揭示了扩增事件先于点突变发生——此前未报告的时间顺序关系——仅在引入超过70个额外项目后才能被检测到。
  • 只有当 n≥50 时,IDH1突变先于TP53突变的时间顺序才被确认为稳健,表明先前的观察结果可能源于优化伪影。
  • 对于MDM2和CDK4扩增,未推断出明确的时间顺序,与先前相互矛盾的结论相悖,表明新方法显著提升了推断的可靠性。
  • 学习到的参数矩阵 Θ 呈现出近似分块对角结构,支持了理论主张:独立项目有助于稳定推断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。