Skip to main content
QUICK REVIEW

[论文解读] Principal component analysis based clustering for high-dimension, low-sample-size data

Kazuyoshi Yata, Makoto Aoshima|arXiv (Cornell University)|Mar 16, 2015
Random Matrices and Applications参考文献 17被引用 4
一句话总结

本文为在高维低样本量(HDLSS)数据中使用主成分分析(PCA)进行聚类建立了理论基础。结果表明,在特定条件下,当维度 d → ∞ 时,样本主成分得分具有几何一致性,即使样本量 n 固定,也能以高概率将数据分类为 k 个组。

ABSTRACT

In this paper, we consider clustering based on principal component analysis (PCA) for high-dimension, low-sample-size (HDLSS) data. We give theoretical reasons why PCA is effective for clustering HDLSS data. First, we derive a geometric representation of HDLSS data taken from a two-class mixture model. With the help of the geometric representation, we give geometric consistency properties of sample principal component scores in the HDLSS context. We develop ideas of the geometric representation and geometric consistency properties to multiclass mixture models. We show that PCA can classify HDLSS data under certain conditions in a surprisingly explicit way. Finally, we demonstrate the performance of the clustering by using microarray data sets.

研究动机与目标

  • 为在高维低样本量(HDLSS)数据设置下应用 PCA 进行聚类提供理论依据。
  • 研究在 HDLSS 渐近情形(d → ∞,n 固定)下样本主成分得分的几何行为。
  • 在不假设协方差矩阵相等的前提下,建立多类别混合模型下 PC 得分的一致性性质。
  • 证明在对均值和协方差结构施加明确条件时,PCA 可有效对 HDLSS 数据进行分类。
  • 使用真实微阵列基因表达数据集验证该方法。

提出的方法

  • 从双类混合模型推导出 HDLSS 数据的几何表示,表明数据点在高维空间中会集中在不同的方向上。
  • 在弱矩条件和混合条件之下,引入维度 d 增加时样本主成分得分的几何一致性性质。
  • 将几何表示应用于多类混合模型,证明主导 PC 得分在渐近意义上可分离不同群体。
  • 利用总体协方差矩阵 Σ 的特征分解,并在 HDLSS 条件下对特征向量和特征值进行渐近分析。
  • 证明在一元双类情形下,第一主成分方向与总体均值之差对齐,且收敛速度为 nη₁η₂(当 d → ∞ 时)。
  • 采用降噪技术与渐近理论,在非高斯、非独立同分布的 HDLSS 设置下推导出 PC 得分与方向的一致估计量。

实验结果

研究问题

  • RQ1在样本量固定、维度发散的 HDLSS 数据中,PCA 在何种条件下能提供一致的聚类结果?
  • RQ2当 d → ∞ 时,样本主成分得分在高维混合模型中的几何行为如何?
  • RQ3在多类 HDLSS 混合模型中,主导主成分方向能否一致地分离不同群体?
  • RQ4在一元双类 HDLSS 设置下,第一 PC 得分的渐近行为是什么?其与总体均值差异有何关联?
  • RQ5该方法在真实世界 HDLSS 数据(如微阵列基因表达数据集)中的表现如何?

主要发现

  • 在一元双类 HDLSS 模型中,第一主成分得分渐近地分离了两个群体,且归一化得分以概率收敛于 1(当 d → ∞ 时)。
  • 在条件 1 下,主导 PC 方向与总体均值之差对齐,且 PC 得分以高概率捕捉到总体分离。
  • 对于多类模型,主导 PC 得分具有几何一致性,当总体均值足够分离时,可将数据分类为 k 个组。
  • 最大特征值与总体协方差矩阵的迹之比在 d → ∞ 时收敛于 1,表明组间方差占主导地位。
  • 即使总体协方差矩阵不相等且数据非高斯,该方法仍能实现一致分类。
  • 微阵列数据的实证结果表明,基于 PCA 的聚类在 HDLSS 设置下能有效识别出具有生物学意义的群体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。