Skip to main content
QUICK REVIEW

[论文解读] Clustering for high-dimension, low-sample size data using distance vectors

Yoshikazu Terada|arXiv (Cornell University)|Dec 12, 2013
Bayesian Methods and Mixture Models参考文献 4被引用 10
一句话总结

本文提出了一种新型的距离向量聚类方法,用于高维低样本量(HDLSS)数据,该方法利用成对距离的大小而非接近度来检测聚类结构。通过使用从内积矩阵或距离矩阵导出的距离向量,该方法在比MDP聚类更宽松的条件下实现了渐近一致的聚类,有效捕捉了聚类间均值向量和方差的差异,且计算复杂度随维度呈线性增长。

ABSTRACT

In high-dimension, low-sample size (HDLSS) data, it is not always true that closeness of two objects reflects a hidden cluster structure. We point out the important fact that it is not the closeness, but the "values" of distance that contain information of the cluster structure in high-dimensional space. Based on this fact, we propose an efficient and simple clustering approach, called distance vector clustering, for HDLSS data. Under the assumptions given in the work of Hall et al. (2005), we show the proposed approach provides a true cluster label under milder conditions when the dimension tends to infinity with the sample size fixed. The effectiveness of the distance vector clustering approach is illustrated through a numerical experiment and real data analysis.

研究动机与目标

  • 解决传统聚类方法在HDLSS数据中因高维空间中误导性接近度而失效的问题。
  • 开发一种通过聚焦于距离大小而非接近度来可靠检测聚类结构的聚类方法。
  • 超越基于均值的聚类,同时捕捉聚类间的方差差异。
  • 在弱于现有方法(如MDP聚类)的条件下,确保渐近标签一致性。
  • 提供一种计算高效、易于实现的方法,仅使用标准的距离矩阵或内积矩阵。

提出的方法

  • 该方法从数据点之间的成对距离或内积构造距离向量,将完整的距离向量作为特征表示。
  • 在距离向量矩阵上应用标准聚类算法(例如k-means、Ward方法),将每个点的距离轮廓视为其特征向量。
  • 该方法依赖于HDLSS中距离大小的渐近行为,即使接近度无法反映聚类结构,距离值仍能体现聚类特征。
  • 理论分析表明,在Hall等(2005)的假设下,当维度p → ∞且样本量N固定时,该方法在更宽松的条件下实现真实聚类标签的渐近一致性。
  • 该方法计算效率高,复杂度随维度p呈线性增长,适用于高维数据。
  • 提出了两种变体:一种使用内积矩阵(DSKM/DDKM),另一种使用距离矩阵(DSW/DDW),均通过实证测试验证。

实验结果

研究问题

  • RQ1在HDLSS数据中,距离大小是否能比接近度更可靠地揭示聚类结构?
  • RQ2基于完整距离向量的聚类方法是否在HDLSS设置下优于基于接近度的方法?
  • RQ3所提出的方法能否检测到聚类间均值向量和方差的差异?
  • RQ4当维度p → ∞时,距离向量聚类在何种条件下可实现渐近标签一致性?
  • RQ5在真实和模拟的HDLSS数据上,距离向量聚类的性能与MDP聚类及其他标准方法相比如何?

主要发现

  • 当维度p → ∞且样本量固定时,距离向量聚类在比MDP聚类更宽松的条件下实现了渐近标签一致性。
  • 该方法成功检测到基于均值和方差差异的聚类结构,而MDP聚类仅关注均值差异。
  • 在数值实验中,该方法表现出具有竞争力的性能,DDKM(基于距离矩阵的k-means)在Colon数据上仅出现17个错误,在Leukemia数据上仅出现1个错误。
  • 在真实微阵列数据集上,DDKM在Lymphoma(3个聚类)上仅出现1个错误,在Prostate(2个聚类)上出现40个错误,某些情况下优于MDP聚类。
  • 该方法对聚类方差异质性具有鲁棒性,与MDP聚类相比对方差差异的敏感性更低。
  • 该方法计算效率高,维度上呈线性扩展,适用于高维数据集的实际应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。