Skip to main content
QUICK REVIEW

[论文解读] Coupled Compound Poisson Factorization

Mehmet Emin Basbug, Barbara E. Engelhardt|arXiv (Cornell University)|Jan 9, 2017
Bayesian Methods and Mixture Models参考文献 16被引用 4
一句话总结

本文提出耦合复合泊松因子分解(CCPF),一种通过将分层复合泊松因子分解作为缺失编码模型与任意数据生成模型(如高斯混合模型、线性回归、矩阵因子分解)耦合,来建模极稀疏数据集中不可忽略的缺失数据的框架。该方法通过变分贝叶斯推断显式建模缺失数据机制,显著提升了测试对数似然和预测性能。

ABSTRACT

We present a general framework, the coupled compound Poisson factorization (CCPF), to capture the missing-data mechanism in extremely sparse data sets by coupling a hierarchical Poisson factorization with an arbitrary data-generating model. We derive a stochastic variational inference algorithm for the resulting model and, as examples of our framework, implement three different data-generating models---a mixture model, linear regression, and factor analysis---to robustly model non-random missing data in the context of clustering, prediction, and matrix factorization. In all three cases, we test our framework against models that ignore the missing-data mechanism on large scale studies with non-random missing data, and we show that explicitly modeling the missing-data mechanism substantially improves the quality of the results, as measured using data log likelihood on a held-out test set.

研究动机与目标

  • 解决在协同过滤和矩阵因子分解中极稀疏数据集里非随机、不可忽略缺失数据的挑战。
  • 开发一个统一的概率框架,显式建模缺失数据机制,而非假设其为可忽略的。
  • 通过将缺失机制整合到数据生成模型中,提升聚类、预测和矩阵因子分解中的推断质量。
  • 证明显式建模缺失数据机制可显著提升真实世界稀疏数据集上的测试对数似然和预测性能。
  • 提供适用于高稀疏性和复杂缺失模式大规模数据集的可扩展推断算法。

提出的方法

  • 提出一种耦合模型,其中分层复合泊松因子分解作为缺失编码模型,捕捉缺失条目的机制。
  • 通过联合似然公式将缺失编码模型与任意数据生成模型(如高斯混合、线性回归、PMF、HPF)集成。
  • 推导出一种随机变分推断(SVI)算法,以实现在大规模设置下的可扩展后验推断。
  • 使用共轭指数族先验和条件共轭后验,确保推断过程的计算可行性。
  • 通过允许缺失过程依赖于未观测数据(NMAR)来建模不可忽略的缺失性,从而改善参数估计。
  • 将该框架应用于多种模型:混合模型用于聚类,线性回归用于预测,矩阵因子分解用于协同过滤。

实验结果

研究问题

  • RQ1在稀疏数据集中显式建模缺失数据机制是否能提升聚类、预测和矩阵因子分解任务的性能?
  • RQ2在不可忽略缺失性场景下,忽略缺失数据机制的模型与显式建模该机制的模型相比,性能差异如何?
  • RQ3将用于缺失性的复合泊松因子分解与不同数据生成模型耦合,能在多大程度上提升测试对数似然和预测准确性?
  • RQ4建模缺失数据机制带来的性能提升是否因数据生成模型类型(如GMM vs. PMF vs. 回归)和数据类型(连续、离散、二值)而异?
  • RQ5所提出的框架能否有效扩展到大规模真实世界数据集(如MovieLens、Amazon、Netflix和Yelp)并处理极端稀疏性?

主要发现

  • CCPF在所有评估模型(混合模型、线性回归、矩阵因子分解)上均一致提升了大规模稀疏数据集的测试集对数似然。
  • 在混合模型设置中,CCPF-GMM在Amazon、Netflix、Yelp和GEUVADIS数据上优于GMM,仅在MovieLens数据上GMM略胜一筹。
  • 在矩阵因子分解中,CCPF-PMF在MovieLens、Amazon、Netflix和Yelp上均取得最高测试对数似然,显著优于PMF和HPF。
  • 在WordPress社交媒体数据集上,基于泊松的模型(HPF和CCPF-HPF)优于基于高斯的模型(PMF和CCPF-PMF),表明响应分布匹配的重要性。
  • 在线性回归中,CCPF-Regr. 的测试对数似然更高(-1.907 vs. -1.921),RMSE更低(1.694 vs. 1.731),且R²更高(0.360 vs. 0.333),优于标准回归模型。
  • 耦合机制的影响在影响离散参数(如GMM)的模型中最为显著,而在均值参数化模型(如PMM)中则较弱,表明当机制影响方差结构时,耦合最为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。