Skip to main content
QUICK REVIEW

[论文解读] Zero-Truncated Poisson Tensor Factorization for Massive Binary Tensors

Changwei Hu, Piyush Rai|arXiv (Cornell University)|Aug 18, 2015
Tensor decomposition and applications参考文献 23被引用 22
一句话总结

本文提出了一种可扩展的贝叶斯零截断泊松张量分解模型,用于处理大规模稀疏二值张量,利用仅依赖于观测到的1值的似然函数,实现非零条目数量上的线性可扩展性。该方法支持批量和在线MCMC推理,通过模式网络整合辅助信息,并在保持或提升真实世界数据准确性的前提下,相比逻辑斯蒂似然模型实现了高达10倍的加速。

ABSTRACT

We present a scalable Bayesian model for low-rank factorization of massive tensors with binary observations. The proposed model has the following key properties: (1) in contrast to the models based on the logistic or probit likelihood, using a zero-truncated Poisson likelihood for binary data allows our model to scale up in the number of \emph{ones} in the tensor, which is especially appealing for massive but sparse binary tensors; (2) side-information in form of binary pairwise relationships (e.g., an adjacency network) between objects in any tensor mode can also be leveraged, which can be especially useful in "cold-start" settings; and (3) the model admits simple Bayesian inference via batch, as well as \emph{online} MCMC; the latter allows scaling up even for \emph{dense} binary data (i.e., when the number of ones in the tensor/network is also massive). In addition, non-negative factor matrices in our model provide easy interpretability, and the tensor rank can be inferred from the data. We evaluate our model on several large-scale real-world binary tensors, achieving excellent computational scalability, and also demonstrate its usefulness in leveraging side-information provided in form of mode-network(s).

研究动机与目标

  • 解决现有二值张量分解模型在计算上效率低下、其复杂度依赖于整个张量体积(包括零值)的问题,特别是在大规模稀疏二值数据中。
  • 开发一种与张量中1的个数呈线性关系的模型,避免对零条目进行昂贵的计算评估。
  • 通过整合二值成对关系(如合作者关系或友谊网络)形式的辅助信息,在冷启动场景中实现有效的推理。
  • 通过贝叶斯非参数先验实现自动秩选择,获得可解释的非负因子矩阵。

提出的方法

  • 对每个二值观测使用零截断泊松似然函数,消除对零条目进行似然评估的需求,从而实现在1的个数上的线性时间复杂度。
  • 在因子矩阵列上使用狄利克雷先验以强制实现非负性并提升可解释性,张量秩由数据自动推断。
  • 支持批量和在线MCMC推理,后者通过小批量更新实现对密集二值张量的可扩展性。
  • 将模式网络(如作者合作者网络)作为额外的二值观测,通过相同的零截断泊松似然函数进行建模。
  • 采用典型多维分析(CP)张量分解框架,将张量表示为秩-1分量的和,其中因子矩阵为学习所得。
  • 使用具有共轭先验的层次贝叶斯模型,以实现高效的后验计算和自动秩估计。

实验结果

研究问题

  • RQ1贝叶斯张量分解模型是否能在大规模稀疏二值张量的非零条目数量上实现线性可扩展性?
  • RQ2使用零截断泊松似然函数是否在计算效率和预测准确性方面优于逻辑斯蒂或 probit 似然函数?
  • RQ3以部分观测到的二值网络(如合作者关系)形式存在的辅助信息,在冷启动设置中能在多大程度上提升性能?
  • RQ4在线MCMC推理是否能有效扩展到非零条目数量也很大的密集二值张量?

主要发现

  • 所提出的模型在真实世界二值张量上相比基于逻辑斯蒂似然的模型实现了高达10倍的加速,同时保持或提升了预测性能。
  • 在冷启动设置中,整合模式网络(如合作者关系)使Facebook数据的AUC-ROC从0.8897提升至0.9075,Scholars数据从0.8051提升至0.8124。
  • 整合网络信息后,Facebook数据的AUC-PR从0.6076提升至0.7255,Scholars数据从0.5763提升至0.6450,表明精度-召回率性能显著增强。
  • 潜在因子分析揭示了可解释的主题,如进化生物学、医学影像、机器学习/信号处理和肿瘤学,其词项和会议/期刊分配具有高度一致性。
  • 在冷启动设置中,加入网络辅助信息的模型能正确将保留的作者分配至与主题相关的院系,而基线模型未使用网络信息则无法做到。
  • 该模型成功从数据中推断出张量秩,并通过狄利克雷先验生成非负且可解释的因子矩阵。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。