Skip to main content
QUICK REVIEW

[论文解读] Online Tensor Methods for Learning Latent Variable Models

Furong Huang, U. N. Niranjan|arXiv (Cornell University)|Sep 3, 2013
Tensor decomposition and applications参考文献 46被引用 9
一句话总结

本文提出一种基于随机梯度下降的在线张量分解方法,用于学习重叠社区和主题模型的潜在变量模型,通过避免显式张量构造来降低计算和存储成本。在Facebook、DBLP和纽约时报等真实数据集上,该方法实现了最先进水平的准确率,并获得了数个数量级的速度提升,相较于变分推断方法在效率和鲁棒性方面均表现更优。

ABSTRACT

We introduce an online tensor decomposition based approach for two latent variable modeling problems namely, (1) community detection, in which we learn the latent communities that the social actors in social networks belong to, and (2) topic modeling, in which we infer hidden topics of text articles. We consider decomposition of moment tensors using stochastic gradient descent. We conduct optimization of multilinear operations in SGD and avoid directly forming the tensors, to save computational and storage costs. We present optimized algorithm in two platforms. Our GPU-based implementation exploits the parallelism of SIMD architectures to allow for maximum speed-up by a careful optimization of storage and data transfer, whereas our CPU-based implementation uses efficient sparse matrix computations and is suitable for large sparse datasets. For the community detection problem, we demonstrate accuracy and computational efficiency on Facebook, Yelp and DBLP datasets, and for the topic modeling problem, we also demonstrate good performance on the New York Times dataset. We compare our results to the state-of-the-art algorithms such as the variational method, and report a gain of accuracy and a gain of several orders of magnitude in the execution time.

研究动机与目标

  • 开发一种可扩展、高效的框架,利用基于张量的方法学习重叠社区和主题,并具备强统计保证。
  • 通过使用隐式张量计算,解决大规模潜在变量模型中显式张量运算的计算不可行性问题。
  • 通过在矩张量上使用随机梯度下降,实现潜在变量模型的在线学习。
  • 提供一种统一的方法,适用于包括有向、无向和二分图在内的多种图类型。
  • 克服现有变分方法的局限性,如固定连通性假设,以及在稀疏或复杂网络中可扩展性差的问题。

提出的方法

  • 使用在线随机梯度下降(SGD)优化从数据中提取的经验矩张量上的多线性运算。
  • 通过矩阵和向量运算隐式计算张量操作,避免显式张量构造,从而降低内存和计算成本。
  • 利用稀疏矩阵表示,在大规模稀疏数据集(如社交网络和文本语料)上实现高效计算。
  • 实现基于GPU的版本,利用SIMD并行性以获得最大加速,优化内存访问和数据传输。
  • 开发基于CPU的实现,利用高效的稀疏线性代数库,适用于超出GPU内存容量的数据集。
  • 应用假设检验,结合p值和错误发现率,评估社区恢复效果,无需手动调整社区数量。

实验结果

研究问题

  • RQ1通过SGD实现的在线张量分解能否在真实世界社交网络中实现高准确率和可扩展性,以学习重叠社区?
  • RQ2在大规模数据集上,该方法与最先进变分推断方法相比,在准确率和运行时间方面表现如何?
  • RQ3隐式张量操作在不牺牲模型性能的前提下,能在多大程度上降低计算和存储成本?
  • RQ4该方法能否在不同图类型(包括二分图和有向图)上泛化,而现有变分方法则不能?
  • RQ5使用p值和错误发现率评估社区检测准确率,在无需预先知晓社区数量的情况下,其有效性如何?

主要发现

  • 在DBLP数据集(100万个节点,1600万个边,250个社区)上,该方法在排除I/O开销的情况下,计算时间不足两分钟,错误率仅为10%。
  • 在Facebook数据集上,该方法成功以高准确率恢复了高中、宿舍和第二专业等结构,反映了真实世界的社会组织。
  • 在纽约时报数据集(10万个词,30万个文档)上,该算法运行时间约为两分钟,学习到了可解释的主题,并识别出跨主题常见的“桥梁”词汇。
  • 基于GPU的实现相较于Gopalan等人(2012年)的随机变分推断方法实现了数个数量级的速度提升,尤其在大规模稀疏图上表现显著。
  • 该方法在准确率和效率方面均优于变分推断,且不受限于同质连通性模型。
  • 使用p值进行评估消除了对社区数量进行调参的需要,提供了灵活且鲁棒的恢复性能评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。