Skip to main content
QUICK REVIEW

[论文解读] A Harmonic Extension Approach for Collaborative Ranking

Da Kuang, Zuoqiang Shi|arXiv (Cornell University)|Feb 16, 2016
Recommender Systems and Techniques参考文献 19被引用 4
一句话总结

该论文提出LDM(低维流形)这一新型协同排序方法,将矩阵补全问题建模为在用户或物品流形上的调和延拓问题,通过最小化流形固有维数来传播评分,利用拉普拉斯-贝尔特拉米方程实现。该方法在低评分条件下表现出卓越的计算效率与鲁棒性排序性能,运行时间优于SVD和LCR,同时保持了具有竞争力的NDCG得分。

ABSTRACT

We present a new perspective on graph-based methods for collaborative ranking for recommender systems. Unlike user-based or item-based methods that compute a weighted average of ratings given by the nearest neighbors, or low-rank approximation methods using convex optimization and the nuclear norm, we formulate matrix completion as a series of semi-supervised learning problems, and propagate the known ratings to the missing ones on the user-user or item-item graph globally. The semi-supervised learning problems are expressed as Laplace-Beltrami equations on a manifold, or namely, harmonic extension, and can be discretized by a point integral method. We show that our approach does not impose a low-rank Euclidean subspace on the data points, but instead minimizes the dimension of the underlying manifold. Our method, named LDM (low dimensional manifold), turns out to be particularly effective in generating rankings of items, showing decent computational efficiency and robust ranking quality compared to state-of-the-art methods.

研究动机与目标

  • 为解决传统协同过滤方法在Top-N推荐中因侧重评分精度而非排序质量而存在的局限性。
  • 提出一种基于几何的矩阵补全方法,避免低秩假设,转而基于用户或物品流形的固有维数进行正则化。
  • 提升协同排序中的计算效率与鲁棒性,特别是在训练数据稀疏的情况下。
  • 提供一种连续的、基于流形的标签传播公式,可在多样化数据集与超参数设置下实现良好泛化。

提出的方法

  • 该方法将协同排序建模为用户-用户或物品-物品图上的半监督学习问题,通过调和延拓传播已知评分。
  • 将每个物品的评分函数建模为在用户流形上的光滑函数,并通过最小化Dirichlet能量泛函来强制实现光滑性。
  • 利用点积分法对连续的调和延拓问题进行离散化,在流形上求解拉普拉斯-贝尔特拉米方程。
  • 该方法通过最小化用户或物品流形的固有维数进行正则化,而非强加低秩欧几里得结构。
  • 该方法完全可并行化,因为每个物品的线性系统相互独立,支持分布式计算。
  • 采用由权重矩阵定义的用户-用户或物品-物品相似性图,实现图上全局标签传播。

实验结果

研究问题

  • RQ1基于几何流形的矩阵补全方法是否能在协同排序中超越传统的低秩或基于邻居的方法?
  • RQ2与核范数或低秩逼近相比,最小化用户或物品流形的固有维数如何提升排序质量?
  • RQ3调和延拓公式是否在训练数据稀疏时展现出更好的鲁棒性与效率?
  • RQ4该方法在数据规模增大及用户训练评分数量变化时的可扩展性如何?
  • RQ5通过调和延拓实现的连续标签传播公式,能否通过现代数值方法高效地离散化并求解?

主要发现

  • 在MovieLens-1m数据集上,N=10个用户训练评分时,LDM的NDCG@10得分为0.7295,与SVD(0.6836)相当,但运行时间仅为61.1秒,远低于SVD的844.4秒。
  • 在MovieLens-10m数据集上,N=10时,LDM的NDCG@10得分为0.7077,优于SVD(0.6291)和LCR(0.6866),且运行时间显著低于LCR(1496.3秒 vs. 4544.4秒)。
  • 当每个用户的训练评分数增至50时,LDM保持优异性能(NDCG@10 = 0.7527)且运行时间仅37.0秒,而SVD和LCR的运行时间增加且性能下降。
  • LDM对超参数变化和数据集规模具有鲁棒性,尤其在低信息场景(小N)下表现突出,其速度与排序质量均优于SVD和LCR。
  • 由于依赖用户-用户相似性矩阵,LDM的运行时间随用户数线性增长;而AltSVM的运行时间随训练评分数增加,因此在稀疏数据下LDM更具可扩展性。
  • LDM在训练阶段即完成缺失评分的完整预测,使实际部署中的推理开销可忽略不计,这对生产环境推荐系统而言是一大优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。