[论文解读] Recommendation from Raw Data with Adaptive Compound Poisson Factorization
本文提出自适应复合泊松因子分解(dcPF),通过利用复合泊松结构的自激现象,构建了一个统一框架,用于在推荐系统中建模原始计数数据。该方法通过自然推广原始数据和二值化数据上的泊松因子分解,实现了最先进的推荐性能,具备可扩展的推理能力和对过度离散的强适应性。
Count data are often used in recommender systems: they are widespread (song play counts, product purchases, clicks on web pages) and can reveal user preference without any explicit rating from the user. Such data are known to be sparse, over-dispersed and bursty, which makes their direct use in recommender systems challenging, often leading to pre-processing steps such as binarization. The aim of this paper is to build recommender systems from these raw data, by means of the recently proposed compound Poisson Factorization (cPF). The paper contributions are three-fold: we present a unified framework for discrete data (dcPF), leading to an adaptive and scalable algorithm; we show that our framework achieves a trade-off between Poisson Factorization (PF) applied to raw and binarized data; we study four specific instances that are relevant to recommendation and exhibit new links with combinatorics. Experiments with three different datasets show that dcPF is able to effectively adjust to over-dispersion, leading to better recommendation scores when compared with PF on either raw or binarized data.
研究动机与目标
- 解决在推荐系统中建模过度离散且具有突发性的计数数据的挑战,而无需像二值化这样的预处理步骤。
- 开发一种统一的离散复合泊松因子分解(dcPF)框架,该框架在原始数据和二值化数据上自然推广泊松因子分解(PF)。
- 通过灵活的元素分布实现闭式后验更新和可扩展推理,以适应过度离散。
- 通过第三类斯特林数(Lah数)建立dcPF与组合数学之间的理论和实证联系。
提出的方法
- 将dcPF建模为层次化模型,其中观测到的计数通过具有潜在会话计数和特定项目的自激效应的复合泊松过程生成。
- 使用指数分散(ED)分布作为元素分布,以建模用户交互的突发性,其中参数θ控制过度离散。
- 通过利用复合泊松结构的共轭性和可扩展性,推导出潜在因子W和H的闭式后验更新。
- 引入一种新的偏移负二项分布作为元素分布,以更好地建模高方差计数数据。
- 使用具有自适应参数化的变分推理方法将模型应用于真实世界数据集,以处理稀疏且过度离散的数据。
- 证明当θ → θ_raw和θ → θ_bin时,dcPF分别退化为原始数据上的PF和二值化数据上的PF。
实验结果
研究问题
- RQ1统一的因子分解框架能否在保持可扩展性和对过度离散的适应性的同时,有效建模推荐系统中的原始计数数据?
- RQ2dcPF如何在原始数据和二值化数据上推广泊松因子分解?这种推广的理论极限是什么?
- RQ3元素分布如何捕捉突发性和过度离散的用户行为?组合结构如第三类斯特林数与之有何关联?
- RQ4新的元素分布(如偏移负二项分布)是否能相比标准选择,在高方差计数数据上提升建模性能?
- RQ5在推荐准确性和对数据离散度的适应性方面,dcPF在原始数据或二值化数据上的表现相比传统PF有多大的优势?
主要发现
- 在三个真实世界数据集(Taste Profile、NIPS、Last.fm)上,dcPF在原始数据和二值化数据上的推荐性能均优于PF,平均倒数排名(MRR)提升最高达10%。
- 模型的自然参数θ(log(p))与非零计数的方差-均值比强相关,证明其对过度离散的适应性:例如,Last.fm的θ为17.0。
- 数学上已证明,当θ → θ_raw(其中κᵀψ(θ) → -∞)时,dcPF收敛于原始数据上的PF;当θ → θ_bin(其中κᵀψ(θ) → +∞)时,收敛于二值化数据上的PF。
- 使用偏移负二项分布作为元素分布可更好地建模高方差数据,三个数据集的p值学习结果分别为0.87、0.86和0.90。
- 该框架揭示了与组合数学的新联系,表明模型中的归一化常数与第三类斯特林数(Lah数)相关,后者用于计数元素的有序划分。
- 由于采用闭式更新且仅依赖非零条目,推理算法保持了可扩展性,同时保留了传统PF方法的效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。