Skip to main content
QUICK REVIEW

[论文解读] Multiway clustering via tensor block models

Miaoyan Wang, Yuchen Zeng|arXiv (Cornell University)|Jun 10, 2019
Tensor decomposition and applications参考文献 27被引用 22
一句话总结

本文提出了一种张量块模型(TBM),用于在噪声张量中进行多路聚类,采用统一的最小二乘估计方法恢复多模式下的块结构。该方法实现了划分一致性与统计收敛性,并通过稀疏扩展实现了对高均值子张量的检测,在模拟数据和基因表达、多层网络等真实数据上的表现优于以往方法。

ABSTRACT

We consider the problem of identifying multiway block structure from a large noisy tensor. Such problems arise frequently in applications such as genomics, recommendation system, topic modeling, and sensor network localization. We propose a tensor block model, develop a unified least-square estimation, and obtain the theoretical accuracy guarantees for multiway clustering. The statistical convergence of the estimator is established, and we show that the associated clustering procedure achieves partition consistency. A sparse regularization is further developed for identifying important blocks with elevated means. The proposal handles a broad range of data types, including binary, continuous, and hybrid observations. Through simulation and application to two real datasets, we demonstrate the outperformance of our approach over previous methods.

研究动机与目标

  • 开发一个统一的统计框架,用于在噪声张量中识别多路块结构。
  • 在张量维度不断增加的条件下,为所提出的估计器建立理论收敛保证。
  • 实现在所有张量模式下的同时聚类与估计,从而在准确性上优于两步法。
  • 通过稀疏正则化扩展模型,以检测具有高均值的子张量。
  • 在包括二值、连续和混合观测在内的多种数据类型上展示方法的鲁棒性。

提出的方法

  • 提出一种张量块模型(TBM),假设张量中存在潜在的棋盘状结构,即块内均值恒定。
  • 开发一种统一的最小二乘估计程序,联合估计所有张量模式下的块成员关系与块均值。
  • 利用多线性代数运算,包括张量多线性乘法和Frobenius范数最小化,定义估计目标。
  • 通过ℓ₀惩罚施加稀疏正则化,以选择具有高均值的重要块,尤其适用于稀疏信号场景。
  • 采用交替优化算法,迭代更新核心张量与成员关系矩阵,每轮迭代复杂度为O(d)。
  • 建立高概率误差界,并证明随着张量维度增加,划分一致性成立。

实验结果

研究问题

  • RQ1统一的最小二乘估计程序是否能在大规模、噪声张量中实现理论保证下的多路块结构恢复?
  • RQ2所提出的TBM是否在收敛速度和聚类准确性上优于低秩张量分解或两步聚类方法?
  • RQ3TBM的稀疏扩展是否能有效检测高维、噪声数据中具有高均值的子张量?
  • RQ4该方法在包括二值、连续和混合观测在内的多种数据类型上的表现如何?
  • RQ5所提出的方法是否对未知的张量索引重排具有鲁棒性,并可扩展至大规模张量?

主要发现

  • 所提出的估计器实现了统计收敛性,其高概率误差界与张量维度和噪声水平成比例。
  • 聚类过程实现了划分一致性,即随着张量规模增大,能以高概率正确恢复真实的块结构。
  • 在模拟实验中,该方法对(40,40,40)张量的块数估计为(R1,R2,R3) = (2,3,4),偏差极小:(2.00, 2.96, 3.96) ± (0, 0.03, 0.03)。
  • 在GTEx多组织基因表达数据上,该方法识别出四个具有生物学意义的组织聚类,块结构显示出过度表达和低表达模式(例如,簇1中GFAP的均值为10.88)。
  • 在Nations数据集中,稀疏TBM检测到五个国家聚类,并识别出14个主要政治关系块,二值条目均值接近1。
  • 在模拟和真实数据中,该方法均优于现有方法,收敛更快,且对高均值块的检测能力更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。