Skip to main content
QUICK REVIEW

[论文解读] Scoup-SMT: Scalable Coupled Sparse Matrix-Tensor Factorization

Evangelos E. Papalexakis, Tom M. Mitchell|arXiv (Cornell University)|Feb 28, 2013
Tensor decomposition and applications参考文献 23被引用 8
一句话总结

Scoup-SMT 是一种快速、并行且促进稀疏性的耦合矩阵-张量分解(CMTF)算法,相比最先进方法将 CMTF 加速了 50–100 倍,同时使稀疏性提升 5 倍。该算法能够稳健地分解稀疏的、耦合的张量-矩阵数据,即使存在缺失条目也表现良好,并在脑成像(BrainQ)和社会网络(Facebook)数据集上有效揭示了潜在语义结构与异常模式。

ABSTRACT

How can we correlate neural activity in the human brain as it responds to words, with behavioral data expressed as answers to questions about these same words? In short, we want to find latent variables, that explain both the brain activity, as well as the behavioral responses. We show that this is an instance of the Coupled Matrix-Tensor Factorization (CMTF) problem. We propose Scoup-SMT, a novel, fast, and parallel algorithm that solves the CMTF problem and produces a sparse latent low-rank subspace of the data. In our experiments, we find that Scoup-SMT is 50-100 times faster than a state-of-the-art algorithm for CMTF, along with a 5 fold increase in sparsity. Moreover, we extend Scoup-SMT to handle missing data without degradation of performance. We apply Scoup-SMT to BrainQ, a dataset consisting of a (nouns, brain voxels, human subjects) tensor and a (nouns, properties) matrix, with coupling along the nouns dimension. Scoup-SMT is able to find meaningful latent variables, as well as to predict brain activity with competitive accuracy. Finally, we demonstrate the generality of Scoup-SMT, by applying it on a Facebook dataset (users, friends, wall-postings); there, Scoup-SMT spots spammer-like anomalies.

研究动机与目标

  • 为解决现有 CMTF 算法在扩展至大规模、稀疏的耦合张量-矩阵数据集时计算效率低下的问题。
  • 开发一种可扩展、并行的算法,在不牺牲近似精度的前提下,促进因子分解潜在子空间的稀疏性。
  • 确保在现实世界数据集中条目不完整或存在噪声时,对缺失数据具有鲁棒性。
  • 通过联合建模张量和矩阵,实现在多模态数据(如脑活动与行为反应)中的有效知识发现。
  • 通过在神经科学与社交网络分析等不同领域应用该方法,证明其通用性。

提出的方法

  • Scoup-SMT 采用基于采样的随机化方法,加速 CMTF 中交替最小二乘法(ALS)求解器的计算,通过因子更新的随机近似降低计算成本。
  • 提出一种新型采样方案,在显著减少每轮迭代操作数的同时保持高精度,支持在多个核心上实现并行计算。
  • 通过采样机制隐式促进稀疏性,自然偏好稀疏因子矩阵,而无需显式使用 ℓ₁ 正则化。
  • 通过仅考虑观测条目的方式修改优化目标,将 CMTF 框架扩展以处理缺失数据,确保在高缺失率下仍保持稳定性能。
  • 利用张量展开与 Khatri-Rao 积,高效计算共享模式下耦合数据结构的低秩近似。
  • 采用并行实现方式,将任务分发至多个 CPU 核心,在 BrainQ 和 Facebook 等大规模数据集上实现显著加速。

实验结果

研究问题

  • RQ1能否设计一种 CMTF 算法,使其在因子分解表示中同时实现高速度与高稀疏性?
  • RQ2当输入张量和矩阵中缺失数据比例增加时,Scoup-SMT 的性能如何退化?
  • RQ3Scoup-SMT 能否在多模态数据(如脑活动与语义响应)中发现有意义且可解释的潜在因子?
  • RQ4在真实世界数据集上,Scoup-SMT 是否在速度与精度方面优于现有 CMTF 求解器?
  • RQ5在具有辅助信息的社会网络数据中,Scoup-SMT 是否能检测到异常模式(如垃圾信息行为)?

主要发现

  • 在 BrainQ 数据集上,Scoup-SMT 相较于传统基于 ALS 的 CMTF 算法实现了 50–100 倍的加速,同时近似精度损失极小。
  • 与基线方法相比,该算法使因子矩阵的稀疏性提高了 5 倍,且无需显式正则化。
  • 即使在高达 50% 的条目缺失情况下,Scoup-SMT 仍能保持较高的信噪比(SNR),表现出对缺失数据的强鲁棒性。
  • 在 BrainQ 数据集上,Scoup-SMT 有效识别出与语义和神经解剖学知识一致的可解释潜在概念(如“昆虫”、“工具”)。
  • 在 Facebook 数据集上,Scoup-SMT 通过识别用户交互与好友关系网络中的异常模式,成功检测出类似垃圾用户的行为。
  • 随着采样率增加,该算法性能保持稳定且可扩展,相对成本仅略有上升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。