Skip to main content
QUICK REVIEW

[论文解读] Probabilistic $K$-mean with local alignment for clustering and motif discovery in functional data

Marzia A. Cremona, Francesca Chiaromonte|arXiv (Cornell University)|Aug 14, 2018
Bioinformatics and Genomic Networks参考文献 28被引用 5
一句话总结

该论文提出probKMA,一种新颖的基于局部对齐的 probabilistic K-means 聚类方法,用于在未对齐的功能数据中发现功能基序——即重复出现的典型形状。通过结合局部对齐、基于导数的相似性以及模糊聚类,该方法无需预先指定基序的数量、长度或变异性,即可识别基序,在生长曲线、COVID-19 死亡率和突变分析研究的真实数据及模拟数据中,其表现优于全局方法。

ABSTRACT

We develop a new method to locally cluster curves and discover functional motifs, i.e.~typical ``shapes'' that may recur several times along and across the curves capturing important local characteristics. In order to identify these shared curve portions, our method leverages ideas from functional data analysis (joint clustering and alignment of curves), bioinformatics (local alignment through the extension of high similarity seeds) and fuzzy clustering (curves belonging to more than one cluster, if they contain more than one typical ``shape''). It can employ various dissimilarity measures and incorporate derivatives in the discovery process, thus exploiting complex facets of shapes. We demonstrate the performance of our method with an extensive simulation study, and show how it generalizes other clustering methods for functional data. Finally, we provide real data applications to Berkeley growth data, Italian Covid-19 death curves and ``Omics'' data related to mutagenesis.

研究动机与目标

  • 为解决在未对齐曲线上发现功能基序——即重复出现的局部形状——的统计方法方面的空白。
  • 开发一种无需预先指定基序长度、数量或变异性即可识别基序的方法。
  • 通过聚焦于局部形状相似性而非全局曲线对齐,推广现有的聚类与对齐方法。
  • 实现概率聚类,使曲线可同时属于多个聚类(若其包含多个不同的基序)。
  • 提供一种灵活、数据驱动的方法,适用于单变量和多变量功能数据的基序发现。

提出的方法

  • 采用受生物信息学中 BLAST 启发的种子扩展方法进行局部对齐,以识别高相似性的曲线片段。
  • 采用概率 K-means 框架,其中曲线对聚类的隶属关系为软分配,允许单条曲线关联多个基序。
  • 在相似性度量中同时纳入函数值和导数,以捕捉复杂的形状特征。
  • 应用 B 样条平滑以减少噪声并建模基序内的变异性,从而增强检测的鲁棒性。
  • 实施广义轮廓指数用于聚类评估,并设置后处理阶段以合并相似的基序。
  • 采用基于模拟的推断方法评估所发现基序的统计显著性,同时考虑背景噪声的影响。

实验结果

研究问题

  • RQ1聚类方法是否能在不预先知晓基序长度或数量的情况下,检测未对齐功能数据中的重复局部形状(基序)?
  • RQ2与全局对齐相比,局部对齐在功能数据聚类中的基序发现中起到何种改进作用?
  • RQ3该方法在真实世界的功能数据(如生长曲线和突变分析数据)中,能多大程度上检测出具有生物学意义的基序?
  • RQ4结合导数和平滑处理如何增强在噪声曲线中对细微形状模式的检测能力?
  • RQ5在背景噪声中发现的基序具有多大的统计显著性,以及如何对其进行评估?

主要发现

  • probKMA 在模拟数据中成功识别出功能基序,即使基序较短、噪声较大或分散于不同曲线中。
  • 该方法通过从数据中自适应地学习基序长度和变异性,优于全局对齐和固定长度基序发现方法。
  • 在伯克利生长数据中,probKMA 检测到全局方法未能捕捉的、具有生物学合理性的发育生长模式。
  • 在意大利 COVID-19 死亡率曲线中,该方法揭示了各地区间重复出现的流行病波形,反映出共享的流行病动力学特征。
  • 在突变分析数据中,每个基序均表现出独特的基因组图谱特征——例如,基序 13 富集于外显子和保守元件,提示其具有功能相关性。
  • 该方法偶尔会在背景噪声中检测到“非故意”但统计上可检测的基序,凸显了未来工作中进行显著性检验的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。