[论文解读] Goal Clustering: VNS based heuristics
本文提出了两种基于变量邻域搜索(VNS)的启发式算法来解决目标聚类(GC)问题,该问题旨在最小化聚类数量,同时确保组间变异性的R-squared比率满足预设阈值。这些方法使用k-means和Ward算法生成初始解,计算结果表明在大规模实例上表现优异,尤其在内存密集型问题中,VNS/Ward’s-GC表现出色。
Given a set V of n elements on m attributes, we want to find a partition of V on the minimum number of clusters such that the associated R-squared ratio is at least a given threshold. We denote this problem as Goal Clustering (GC). This problem represents a new perspective, characterizing a different methodology within unsupervised non-hierarchical clustering. In effect, while in the k-means we set the number of clusters in advance and then test the associated R-squared ratio; in the GC we set an R-squared threshold lower limit in advance and minimize k. We present two Variable Neighborhood Search (VNS) based heuristics for the GC problem. The two heuristics use different methodologies to start the VNS algorithms. One is based on the Ward's construction and the other one resorts to the k-means method. Computational tests are conducted over a set of large sized instances in order to show the performance of the two proposed heuristics.
研究动机与目标
- 通过在非层次聚类中最小化聚类数量并满足最小R-squared阈值,解决传统k-means固定聚类数的问题。
- 提出一种新型聚类范式,即从下限约束R-squared比率,并最小化聚类数量。
- 开发并评估两种基于VNS的启发式算法,分别使用k-means和Ward算法作为GC问题的初始解生成器。
- 在合成数据(正态分布和均匀分布)及真实数据集(包括基因表达和ETF价格流)上测试性能。
- 探索未来扩展方向,如为每个属性设置独立的R²阈值以反映变量重要性。
提出的方法
- GC问题被建模为在满足R²(P) ≥ R²T的条件下最小化聚类数k,其中R²衡量组间总变异相对于总变异的比例。
- R²比率计算为SSB/SST,其中SSB和SST分别来自属性层面的组间和总组平方和。
- 提出两种基于VNS的启发式算法:VNS/k-means-GC和VNS/Ward’s-GC,二者在初始解构建方式上有所不同。
- VNS框架通过探索多种邻域结构来逃离局部最优,终止条件由最大抖动步数(r_max)控制。
- 初始解通过k-means和Ward算法生成,后者提供更稳定的初始聚类划分。
- 算法在合成实例(n=100–10,000,m=3–100)和真实数据集(1,744个基因,3,028个ETF交易日)上进行评估,性能指标包括聚类数量和执行时间。
实验结果
研究问题
- RQ1基于VNS的启发式算法在非层次聚类中,能否有效最小化聚类数量并满足最小R-squared阈值?
- RQ2初始解的选择(k-means与Ward算法)是否显著影响VNS在GC问题中的性能与解质量?
- RQ3所提出的启发式算法在问题规模增大时(特别是n ≥ 5,000的大规模实例)的可扩展性如何?
- RQ4VNS/k-means-GC与VNS/Ward’s-GC启发式算法能否高效求解真实世界数据集,如微阵列基因表达数据和ETF价格流?
- RQ5在不同数据分布(正态分布与均匀分布)下,解质量与执行时间之间的计算权衡如何?
主要发现
- 在较小实例(n ≤ 1000)中,VNS/k-means-GC在属性数较少(m ≤ 5)时表现优于VNS/Ward’s-GC,获得更少的聚类数。
- 在较大实例(n = 5,000和10,000)中,VNS/k-means-GC因内存和时间限制而不可行,因此仅能使用VNS/Ward’s-GC。
- 在微阵列基因表达数据集(1,744个基因,45个样本)上,VNS/k-means-GC在9小时内求解完成,而VNS/Ward’s-GC在3小时内提供近似解。
- 在ETF数据流(3,028天,22个国家)上,VNS/k-means-GC耗时近7小时,而VNS/Ward’s-GC耗时不足1小时。
- VNS/Ward’s-GC启发式算法在大规模和真实世界数据集上展现出更优的可扩展性与效率,尽管k-means初始化的执行时间更长。
- 结果表明,Ward算法初始化在大规模GC问题中比k-means更稳定且内存效率更高,尤其在均匀数据分布下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。