[论文解读] Multi-output Polynomial Networks and Factorization Machines
该论文通过在多个输出之间建模共享基向量,提出了一种基于凸、逐行稀疏张量公式的多输出多项式网络与因子分解机。该方法提出了一种带有校正重拟合的条件梯度算法,实现了全局收敛,并在多分类分类与推荐任务中,相较于现有方法展现出更优的准确率与稀疏性。
Factorization machines and polynomial networks are supervised polynomial models based on an efficient low-rank decomposition. We extend these models to the multi-output setting, i.e., for learning vector-valued functions, with application to multi-class or multi-task problems. We cast this as the problem of learning a 3-way tensor whose slices share a common basis and propose a convex formulation of that problem. We then develop an efficient conditional gradient algorithm and prove its global convergence, despite the fact that it involves a non-convex basis selection step. On classification tasks, we show that our algorithm achieves excellent accuracy with much sparser models than existing methods. On recommendation system tasks, we show how to combine our algorithm with a reduction from ordinal regression to multi-output classification and show that the resulting algorithm outperforms simple baselines in terms of ranking accuracy.
研究动机与目标
- 将因子分解机与多项式网络从单输出扩展至多输出设置,以支持多分类与多任务学习。
- 将多输出学习问题建模为在输出切片间共享基的三阶张量学习问题。
- 开发一种使用组稀疏惩罚的凸优化框架,以在无限维矩阵表示中强制实现行级稀疏性。
- 设计一种带有校正重拟合的条件梯度算法,即使在基选择步骤非凸的情况下,也能确保全局收敛。
- 在多分类分类与推荐任务上评估该方法,结果表明其在模型稀疏性与排序性能方面均有提升。
提出的方法
- 该方法将多输出因子分解机与多项式网络建模为学习一个三阶张量,其中每个输出切片共享一个共同的低秩基。
- 通过使用 $l_1/l_q$-范数惩罚,将问题重新表述为在无限维矩阵中实现行级稀疏性的学习问题。
- 开发了一种条件梯度算法,通过在选择新基向量与在当前基上重拟合系数之间交替进行。
- 该算法包含一个校正重拟合步骤,即使在基选择步骤非凸的情况下,也能提升收敛性与稀疏性。
- 通过序数 McRank 约简方法将该方法应用于序数回归,为每个相关性等级训练一个多任务分类器。
- 优化过程使用二元逻辑回归损失,以生成校准的概率,用于 nDCG 等排序指标。
实验结果
研究问题
- RQ1因子分解机与多项式网络能否被有效扩展至多输出学习,以解决多分类与多任务问题?
- RQ2如何将多个输出之间的共享基学习建模为一个凸优化问题?
- RQ3在共享基设置下,带有非凸基选择的条件梯度算法能否实现全局收敛?
- RQ4在分类与推荐任务中,该方法相较于单输出模型与核化基线方法,在准确率与稀疏性方面表现如何?
- RQ5当与序数回归约简结合时,该方法能否提升推荐系统中的排序性能?
主要发现
- 在多分类分类任务中,所提方法的准确率与核SVM相当,但模型稀疏性显著优于Nyström方法。
- 在vowel数据集上,$l_1/l_\infty$-约束变体达到了89.57%的准确率,优于 $l_1$ 和随机初始化的投影梯度下降方法。
- 在推荐系统中,采用 $l_1/l_\infty$ 约束的多输出因子分解机在MovieLens 100k与1M数据集上分别实现了nDCG@1为0.75与0.76,优于单输出因子分解机与多项式网络。
- 在所有测试数据集中,该方法在RMSE与nDCG指标上均优于单输出模型,表明其排序性能更优。
- 尽管基选择步骤非凸,该算法仍实现了全局收敛,证明了校正重拟合策略的理论鲁棒性。
- 模型的稀疏性得到显著提升,最佳模型远比其他方法更稀疏,表明其具有更好的泛化能力与效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。