[论文解读] Scalable Bayesian Non-Negative Tensor Factorization for Massive Count Data
该论文提出了一种可扩展的贝叶斯非负张量分解模型,用于处理大规模计数张量数据,利用贝塔-负二项分布生成模型,并将泊松分布重新参数化为多项分布,以实现共轭性,从而支持高效的吉布斯采样和变分推断。该方法可自动推断张量秩,并提供可解释的主题类因子,结合在线推断机制,实现对传统方法无法处理的大规模张量的可扩展分析。
We present a Bayesian non-negative tensor factorization model for count-valued tensor data, and develop scalable inference algorithms (both batch and online) for dealing with massive tensors. Our generative model can handle overdispersed counts as well as infer the rank of the decomposition. Moreover, leveraging a reparameterization of the Poisson distribution as a multinomial facilitates conjugacy in the model and enables simple and efficient Gibbs sampling and variational Bayes (VB) inference updates, with a computational cost that only depends on the number of nonzeros in the tensor. The model also provides a nice interpretability for the factors; in our model, each factor corresponds to a "topic". We develop a set of online inference algorithms that allow further scaling up the model to massive tensors, for which batch inference methods may be infeasible. We apply our framework on diverse real-world applications, such as \emph{multiway} topic modeling on a scientific publications database, analyzing a political science data set, and analyzing a massive household transactions data set.
研究动机与目标
- 开发一种完全贝叶斯的非负张量分解模型,用于处理大规模、稀疏且过度分散的计数张量数据。
- 实现无需预先指定分解秩的自动秩推断。
- 提供可解释的潜在因子,代表张量模式上的分布(主题),以支持定性分析。
- 设计适用于传统方法无法处理的大规模张量的可扩展批量与在线推断算法。
- 支持现实世界应用,如多维主题建模、政治科学分析以及大规模消费者交易建模。
提出的方法
- 采用贝塔-负二项分布生成模型以捕捉过度分散的计数数据,并实现共轭性。
- 将泊松似然重新表述为多项分布,以实现共轭性,从而支持闭式吉布斯采样和变分贝叶斯更新。
- 在因子矩阵列上应用狄利克雷先验,以确保每个因子代表张量模式对象上的分布(主题)。
- 采用伽马-伽马-泊松层次结构,将张量条目建模为泊松分布的混合。
- 开发两种在线推断算法:在线MCMC与随机变分推断,两者计算成本仅与非零条目数量成正比。
- 采用条件密度过滤与自适应学习率的随机变分推断,以实现对大规模张量的可扩展性。
实验结果
研究问题
- RQ1贝叶斯非负张量分解模型能否有效处理大规模、稀疏且过度分散的计数张量数据?
- RQ2在泊松因子分解这类非共轭模型中,如何实现共轭性以支持高效的吉布斯采样与变分推断?
- RQ3该模型能否在无需人工指定的情况下自动推断张量分解的真实秩?
- RQ4在线推断算法与批量方法相比,在大规模张量上的收敛速度与可扩展性如何?
- RQ5在现实世界应用中,推断出的因子在多大程度上可被解释为有意义的主题或张量模式上的分布?
主要发现
- 所提出的模型成功处理了大规模张量,例如117,054×438×67,095的家用交易数据集,而最先进的方法如PTF和lraNTD因存储与计算限制而失效。
- 在线推断方法(条件密度过滤与随机变分推断)在相同的大规模交易数据上收敛速度显著快于批量方法,且在更短时间内实现了更高的保留对数似然值。
- 与PTF基线相比,该模型在Scholars数据集上的批量推断速度显著更快,尽管处理相同数据,但每轮迭代运行时间大幅减少。
- 推断出的因子具有可解释性:例如在交易数据中,识别出三种不同的消费者行为聚类——热门商店、批发商店与低多样性商店,各自表现出不同的商品偏好与行为模式。
- 模型揭示了消费者购物行为的刚性特征:家庭对特定商店有强烈偏好,仅消费可用食品项目中的一小部分,表明其搜索行为有限。
- 推断出的λ参数表明,100个因子中仅有约60个具有显著性,证明了该模型自动推断分解有效秩的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。