Skip to main content
QUICK REVIEW

[论文解读] Regularized Singular Value Decomposition and Application to Recommender System

Shuai Zheng, Chris Ding|arXiv (Cornell University)|Apr 13, 2018
Blind Source Separation Techniques参考文献 19被引用 14
一句话总结

本文提出正则化奇异值分解(RSVD),一种具有闭式全局解的非凸矩阵分解方法,通过在SVD目标函数中添加Tikhonov正则化来改进低秩逼近。在四个真实世界推荐系统数据集上评估,RSVD在精确率、召回率和F1值上均持续优于标准SVD,最优性能出现在λ=5时。

ABSTRACT

Singular value decomposition (SVD) is the mathematical basis of principal component analysis (PCA). Together, SVD and PCA are one of the most widely used mathematical formalism/decomposition in machine learning, data mining, pattern recognition, artificial intelligence, computer vision, signal processing, etc. In recent applications, regularization becomes an increasing trend. In this paper, we present a regularized SVD (RSVD), present an efficient computational algorithm, and provide several theoretical analysis. We show that although RSVD is non-convex, it has a closed-form global optimal solution. Finally, we apply RSVD to the application of recommender system and experimental result show that RSVD outperforms SVD significantly.

研究动机与目标

  • 开发一种正则化SVD公式,以在存在噪声和过拟合的情况下改进低秩矩阵逼近。
  • 提供一种高效迭代算法,用于求解正则化SVD问题,并保证收敛。
  • 从理论上证明,非凸的RSVD公式具有唯一的全局最优解。
  • 在真实世界推荐系统数据集上实证评估RSVD,并与标准SVD进行性能比较。

提出的方法

  • RSVD目标函数最小化重构误差的Frobenius范数,同时对因子矩阵U和V施加Tikhonov正则化。
  • 采用交替优化算法:固定V,通过U = X V (V^T V + λI)^{-1} 求解U;然后固定U,通过V = X^T U (U^T U + λI)^{-1} 求解V。
  • 该算法被证明能单调减少目标函数,并在问题非凸的情况下收敛至全局最优解。
  • 理论分析表明,最优解位于原始矩阵X的SVD子空间内。
  • 通过建模用户-物品评分矩阵并将缺失评分预测为低秩逼近,将该方法应用于推荐系统。
  • 通过归一化连续迭代间的差异来监控收敛性,dX_t = ||X_t - X_{t-1}||_Ω / sqrt(N_Ω)。

实验结果

研究问题

  • RQ1尽管是非凸的,正则化SVD公式是否具有闭式全局解?
  • RQ2所提出的迭代算法能否收敛至正则化SVD目标的全局最优解?
  • RQ3RSVD在真实世界数据集上是否相比标准SVD提升了推荐准确率?
  • RQ4在实际应用中,RSVD的正则化参数λ的最优值是多少?
  • RQ5RSVD的解是否对因子矩阵的随机初始化具有不变性?

主要发现

  • RSVD为正则化SVD问题实现了闭式全局解,即使目标函数是非凸的。
  • 迭代算法收敛至全局最优解,且当λ>0时,收敛速度优于标准SVD(λ=0)。
  • 在MovieLens数据集上,RSVD在λ=5、秩k=9时F1得分达到0.4542,优于SVD的0.4220。
  • 在Jester1数据集上,RSVD在λ=5、k=18时F1得分达到0.8672,显著优于SVD的0.6188。
  • 在所有四个数据集(MovieLens、RottenTomatoes、Jester1、Jester2)上,λ=5始终产生最高的F1得分,表明其为鲁棒且有效的正则化设置。
  • 精确率和召回率曲线显示,RSVD在λ=5或10时,无论在何种测试秩和数据集上,均持续优于SVD。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。