Skip to main content
QUICK REVIEW

[论文解读] Robust Clustering Using Tau-Scales

Juan Domingo González, Vı́ctor J. Yohai|arXiv (Cornell University)|Jun 19, 2019
Advanced Statistical Methods and Models参考文献 14被引用 5
一句话总结

本文提出 K-Tau 中心,一种基于 Tau-尺度估计量的鲁棒聚类算法,可同时实现高 breakdown 点和高效率,克服了 K-means 和截尾 K-means 的局限性。该方法使用鲁棒尺度度量在聚类中心估计过程中降低异常值的影响,并被证明在温和正则性条件下具有强一致性,收敛于真实总体聚类中心。

ABSTRACT

K means is a popular non-parametric clustering procedure introduced by Steinhaus (1956) and further developed by MacQueen (1967). It is known, however, that K means does not perform well in the presence of outliers. Cuesta-Albertos et al (1997) introduced a robust alternative, trimmed K means, which can be tuned to be robust or efficient, but cannot achieve these two properties simultaneously in an adaptive way. To overcome this limitation we propose a new robust clustering procedure called K Tau Centers, which is based on the concept of Tau scale introduced by Yohai and Zamar (1988). We show that K Tau Centers performs well in extensive simulation studies and real data examples. We also show that the centers found by the proposed method are consistent estimators of the "true" centers defined as the minimizers of the the objective function at the population level.

研究动机与目标

  • 开发一种既对异常值鲁棒又在干净数据中高效的聚类过程,以克服截尾 K-means 中固有的权衡。
  • 通过用基于 Tau-尺度的鲁棒尺度估计量替代欧几里得距离,解决 K-means 对异常值的敏感性问题。
  • 通过证明估计量收敛于目标函数的总体水平最小化器,建立所提估计量的理论一致性。
  • 提供一种实用且自适应的现有鲁棒聚类方法的替代方案,无需预先指定截尾比例。

提出的方法

  • 该方法通过最小化基于 Tau-尺度估计量的鲁棒目标函数来定义聚类中心,该估计量兼具高高斯效率和高 breakdown 点。
  • 采用迭代算法计算中心,其中 Tau-尺度基于数据点到当前聚类中心的距离计算得出。
  • Tau-尺度通过两个有界、偶函数、非减函数 ρ₁ 和 ρ₂ 构建,确保鲁棒性与效率。
  • 通过尺度估计过程自适应地降低远距离点(潜在异常值)的权重,而无需预先指定截尾阈值。
  • 通过估计聚类中心与总体中心之间在 Hausdorff 距离上的收敛性,建立一致性,利用紧集上的大数定律。
  • 理论依据依赖于从一致收敛性和目标函数连续性推导出的强一致性结果。

实验结果

研究问题

  • RQ1能否开发一种聚类过程,在正常数据下保持高效率的同时对异常值保持鲁棒性,且无需预先指定截尾比例?
  • RQ2在聚类中心估计中使用 Tau-尺度是否能导致收敛于真实总体中心的一致估计量?
  • RQ3在存在污染的有限样本中,K-Tau 中心与 K-means 和截尾 K-means 的性能相比如何?
  • RQ4K-Tau 中心估计量在一般条件下的一致性有何理论依据?
  • RQ5该方法能否在包含缺失目标检测的卫星图像等真实世界数据中有效应用?

主要发现

  • K-Tau 中心方法实现了高 breakdown 点和高高斯效率,克服了截尾 K-means 中的根本性权衡。
  • 估计的聚类中心具有强一致性,以概率几乎处处收敛于目标函数的总体最小化器。
  • 模拟研究显示,在存在异常值的情况下,K-Tau 中心在性能上优于 K-means 和截尾 K-means。
  • 该方法成功识别了卫星图像中的聚类,并有助于检测缺失对象,展示了实际应用价值。
  • 理论分析确认,估计中心与真实中心之间的 Hausdorff 距离以概率几乎处处收敛于零。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。