Skip to main content
QUICK REVIEW

[论文解读] Clustering Higher Order Data: An Application to Pediatric Multi-variable Longitudinal Data

Peter A. Tait, Paul D. McNicholas|arXiv (Cornell University)|Jul 19, 2019
Tensor decomposition and applications参考文献 63被引用 5
一句话总结

本文提出了一种有限混合模型,用于对高阶多维数组(张量)进行聚类,其阶数 D > 2,特别应用于儿科纵向研究中的四维加速度计数据。通过使用多线性正态分布将基于模型的聚类方法扩展至多维数组,该方法能够同时分析身体活动中的复杂时间模式与多变量模式,揭示患有慢性炎症性疾病儿童中具有独特活动特征的亚群。

ABSTRACT

Physical activity levels are an important predictor of cardiovascular health and increasingly being measured by sensors, like accelerometers. Accelerometers produce rich multivariate data that can inform important clinical decisions related to individual patients and public health. The CHAMPION study, a study of youth with chronic inflammatory conditions, aims to determine the links between heart health, inflammation, physical activity, and fitness. The accelerometer data from CHAMPION is represented as 4-dimensional arrays, and a finite mixture of multidimensional arrays model is developed for clustering. The use of model-based clustering for multidimensional arrays has thus far been limited to two-dimensional arrays, i.e., matrices or order-two tensors, and the work in this paper can also be seen as an approach for clustering D-dimensional arrays for D > 2 or, in other words, for clustering order-D tensors.

研究动机与目标

  • 开发一种基于模型的聚类方法,用于阶数 D > 2 的多维数组(张量)数据,超越传统的矩阵基聚类方法。
  • 解决纵向健康研究中缺乏对高阶数据聚类的统计方法的问题,特别是在具有复杂多变量身体活动模式的儿科人群中。
  • 实现对加速度计数据中多个时间尺度(秒、分钟、小时)的均值趋势与变异性的联合建模。
  • 利用统一的统计模型识别具有不同身体活动特征的儿童同质亚群。
  • 通过提供与心血管健康结局相关联的丰富高维加速度计数据的低维汇总,支持临床决策。

提出的方法

  • 该方法采用多维数组(MDA)的有限混合模型,其中每个分量遵循多线性正态分布(MLND),以对连续的高阶数据进行建模。
  • 通过为 MDA 的每个模式(维度)设置一组协方差矩阵,对分布进行参数化,从而在所有模式中实现灵活的依赖结构。
  • 使用期望最大化(EM)算法进行参数估计,通过矩阵微分学推导出 Q 函数,以处理多线性结构。
  • 关键组成部分包括模式特定的协方差矩阵 Δg,d 和变换矩阵 Tg,1,用于建模多线性结构并降低维度。
  • 算法通过从 Q 函数导出的得分函数,迭代更新分量权重、均值数组和模式特定协方差矩阵。
  • 该方法支持四维数据(如患者 × 时间 × 活动强度 × 测量窗口)的聚类,实现对复杂纵向模式的联合分析。

实验结果

研究问题

  • RQ1有限混合的多维数组模型能否有效对纵向健康研究中的高阶数据(D > 2)进行聚类?
  • RQ2多线性正态分布如何用于建模儿科加速度计数据中复杂、多变量且多尺度的身体活动模式?
  • RQ3患有慢性炎症性疾病的儿童在身体活动特征上存在哪些不同的表现?与健康对照组相比有何差异?
  • RQ4所提出的模型能否同时捕捉加速度计数据在多个时间尺度(如秒、分钟、小时)上的均值趋势与变异性?
  • RQ5与传统的矩阵基聚类相比,该基于模型的聚类方法在识别具有临床意义的亚群方面有何改进?

主要发现

  • 所提出的多维数组有限混合模型成功地将 CHAMPION 研究中的四维加速度计数据聚类为具有生物学意义的亚群,且各亚群具有独特的身体活动特征。
  • 该模型在一个统一的统计框架内同时捕捉了多个时间尺度(秒、分钟、小时)的均值趋势与变异性,从而实现了对活动模式的更丰富解读。
  • 该方法识别出具有显著不同身体活动行为的儿童亚群,包括低、中、高活动水平的个体,即使在患有慢性炎症性疾病的儿童中亦然。
  • 使用多线性正态分布可灵活建模所有数据维度上的复杂依赖结构,相较于矩阵基方法,显著提升了聚类准确性。
  • EM 算法收敛稳定,推导出的得分函数实现了对高阶数组的高效参数估计。
  • 该方法提供了低维的聚类标签,可作为下游统计模型中的汇总变量,用于连接身体活动与心血管健康结局。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。