Skip to main content
QUICK REVIEW

[论文解读] Multi-sequence segmentation via score and higher-criticism tests

Hock-Peng Chan, Hao Chen|arXiv (Cornell University)|Jun 23, 2017
Genomic variations and chromosomal abnormalities参考文献 17被引用 16
一句话总结

本文提出一种基于评分统计量与高阶临界值检验的多序列分割方法,用于检测多个对齐序列中的变点,扩展了单序列方法。提出了一种新颖的反向分割方法,在基准场景下优于现有方法,并在多患者癌症基因组数据集中实现了更优的检测效果。

ABSTRACT

We propose local segmentation of multiple sequences sharing a common time- or location-index, building upon the single sequence local segmentation methods of Niu and Zhang (2012) and Fang, Li and Siegmund (2016). We also propose reverse segmentation of multiple sequences that is new even in the single sequence context. We show that local segmentation estimates change-points consistently for both single and multiple sequences, and that both methods proposed here detect signals well, with the reverse segmentation method outperforming a large number of known segmentation methods on a commonly used single sequence test scenario. We show that on a recent allele-specific copy number study involving multiple cancer patients, the simultaneous segmentations of the DNA sequences of all the patients provide information beyond that obtained by segmentation of the sequences one at a time.

研究动机与目标

  • 开发一种针对共享共同索引的多序列局部分割方法,以改进单序列变点检测技术。
  • 提出一种新型反向分割方法,适用于单序列场景,提升检测灵敏度。
  • 在所提出的框架下,实现对单序列与多序列中变点的一致性估计。
  • 表明对多序列进行同步分割可获得比单独分割更丰富的信息,尤其在复杂生物数据中表现更优。

提出的方法

  • 将 Niu 和 Zhang(2012)以及 Fang、Li 和 Siegmund(2016)提出的基于评分的检验统计量,拓展至多序列场景,用于变点检测。
  • 提出一种反向分割方法,通过重新加权或重排检验统计量,提升多序列中的检测效能。
  • 利用高阶临界值统计量聚合多序列中的证据,增强对弱信号或稀疏信号的敏感性。
  • 通过组合多序列中的局部检验统计量,应用所提出的方法检测多个对齐序列中的变点。
  • 采用一致估计程序,确保随着样本量增加,变点估计值收敛。
  • 通过模拟实验与真实世界应用(基于癌症患者等位基因特异性拷贝数数据)验证方法性能。

实验结果

研究问题

  • RQ1评分统计量与高阶临界值检验能否有效扩展至具有共享索引的多序列变点检测?
  • RQ2所提出的反向分割方法是否在检测效能上优于现有的单序列与多序列分割技术?
  • RQ3在信号检测准确性方面,多序列的同步分割与单个序列的独立分割相比有何差异?
  • RQ4在现实数据条件下,所提出的方法能否对多序列中变点实现一致估计?

主要发现

  • 所提出的局部分割方法在单序列与多序列场景下均能实现变点的一致性估计。
  • 在标准单序列基准场景中,反向分割方法优于广泛已知的多种分割方法。
  • 对癌症患者多条DNA序列进行同步分割,揭示的生物学相关信号多于单独分割的结果。
  • 高阶临界值检验通过聚合多序列中的弱信号,显著提升了检测能力。
  • 该方法成功识别出等位基因特异性拷贝数数据中的变点,展示了在癌症基因组学中的实际应用价值。
  • 即使在单序列背景下,反向分割方法也具有新颖性,为变点检测提供了新视角。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。