Skip to main content
QUICK REVIEW

[论文解读] Provable Convex Co-clustering of Tensors

C. Eric, Brian R. Gaines|arXiv (Cornell University)|Mar 17, 2018
Tensor decomposition and applications参考文献 102被引用 15
一句话总结

本文提出了一种针对高阶张量(CoCo)的可证明凸共聚类方法,通过在CP分解得到的因子矩阵上使用融合Lasso惩罚,将张量共聚类建模为凸优化问题。关键贡献在于一个非渐近误差界,揭示了‘维度的祝福’现象——即使仅有一个张量样本,且随着张量规模增大而聚类数量增加,仍能实现共聚类的一致恢复。

ABSTRACT

Cluster analysis is a fundamental tool for pattern discovery of complex heterogeneous data. Prevalent clustering methods mainly focus on vector or matrix-variate data and are not applicable to general-order tensors, which arise frequently in modern scientific and business applications. Moreover, there is a gap between statistical guarantees and computational efficiency for existing tensor clustering solutions due to the nature of their non-convex formulations. In this work, we bridge this gap by developing a provable convex formulation of tensor co-clustering. Our convex co-clustering (CoCo) estimator enjoys stability guarantees and its computational and storage costs are polynomial in the size of the data. We further establish a non-asymptotic error bound for the CoCo estimator, which reveals a surprising "blessing of dimensionality" phenomenon that does not exist in vector or matrix-variate cluster analysis. Our theoretical findings are supported by extensive simulated studies. Finally, we apply the CoCo estimator to the cluster analysis of advertisement click tensor data from a major online company. Our clustering results provide meaningful business insights to improve advertising effectiveness.

研究动机与目标

  • 解决现有非凸张量共聚类方法在统计保证和计算效率方面的不足。
  • 为一般阶数张量(D ≥ 3)开发一种凸共聚类公式,确保对潜在聚类结构的稳定且一致的恢复。
  • 通过利用凸优化,弥合张量聚类中统计一致性与计算可及性之间的差距。
  • 建立理论误差界,揭示一种在向量或矩阵聚类中不存在的新现象——‘维度的祝福’。
  • 通过在广告点击张量数据上的真实世界应用,展示其实际效用,获得可操作的业务洞察。

提出的方法

  • 对输入张量应用CANDECOMP/PARAFAC(CP)分解,以获得每个模式的低秩因子矩阵。
  • 对每个因子矩阵应用融合Lasso正则化,以在各模式上诱导分块聚类结构。
  • 将共聚类问题公式化为一个凸优化问题,通过最小化带有融合Lasso惩罚的损失函数来实现。
  • 使用加速一阶方法求解凸优化问题,实现线性存储和与数据规模成线性关系的每轮迭代成本。
  • 通过两阶段过程选择调优参数:使用Sun等(2017)的方法进行秩选择,使用间隙统计量(Tibshirani等,2001)进行聚类数量选择。
  • 通过数据的Lipschitz连续性以及数据与调优参数的联合连续性确保稳定性,支持热启动并增强对扰动的鲁棒性。

实验结果

研究问题

  • RQ1可证明凸的张量共聚类公式能否同时实现统计一致性和计算效率?
  • RQ2所提出的方法是否表现出‘维度的祝福’现象——即随着张量维度增大,性能改善或保持稳定?
  • RQ3当聚类数量随张量规模增长时,CoCo估计器在恢复共聚类结构方面的表现如何?
  • RQ4该方法能否从单个张量样本中一致地恢复出真实的共聚类结构?
  • RQ5在不同张量形状和噪声水平下,CoCo在单模聚类和共聚类准确率方面与CPD+ k-means及CoTeC相比表现如何?

主要发现

  • CoCo估计器实现了随张量规模增长而衰减的非渐近误差界,揭示了‘维度的祝福’现象:即使聚类数量随张量元素数量增加,共聚类仍能一致恢复。
  • CoCo仅需一个张量样本即可以高概率恢复真实共聚类结构,这一特性在向量或矩阵聚类中未被观察到。
  • 在模拟实验中,当噪声水平较低(σ = 2)时,CoCo在调整兰德指数(ARI)上优于CPD+ k-means和CoTeC,尤其在较短模式(n_d = 10)下表现更优,当模式长度增至20时性能接近完美。
  • 在高斯噪声较强(σ = 3)时,性能下降在较长模式上更为明显,但整体共聚类ARI仍与CPD+ k-means相当。
  • 当最短模式较短(n_d = 10)时,CoCo在中等噪声下性能急剧下降,但当最短模式长度增加至20后,该问题显著缓解。
  • 该方法通过数据的Lipschitz连续性以及数据与调优参数的联合连续性表现出强稳定性,支持通过热启动实现鲁棒计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。