Skip to main content
QUICK REVIEW

[论文解读] Towards Large Scale Training Of Autoencoders For Collaborative Filtering

Abdallah Moussawi|arXiv (Cornell University)|Aug 30, 2018
Speech and Audio Processing参考文献 2被引用 5
一句话总结

本文提出了一种小批量负采样方法,以高效训练大规模协同过滤中具有隐式反馈的潜在因子自编码器。通过仅从同一小批量中其他用户交互过的负样本项中采样,该方法将训练时间从 O(|U|×|I|) 降低至 O(m×∑|I_u|),在 CPU 上实现超过 2.3 倍的加速,在 GPU 上实现 2.0 倍的加速,同时保持接近基线的性能(NDCG@100 下降不超过 3.72%)。

ABSTRACT

In this paper, we apply a mini-batch based negative sampling method to efficiently train a latent factor autoencoder model on large scale and sparse data for implicit feedback collaborative filtering. We compare our work against a state-of-the-art baseline model on different experimental datasets and show that this method can lead to a good and fast approximation of the baseline model performance. The source code is available in https://github.com/amoussawi/recoder .

研究动机与目标

  • 解决在大规模稀疏用户-物品交互数据上训练自编码器时计算效率低下的问题。
  • 降低在训练过程中重构高度稀疏、高维交互向量的时间复杂度。
  • 通过有针对性的负采样,在显著加速训练的同时保持高推荐性能。
  • 实现在具有隐式反馈的工业规模数据集上对非线性自编码器模型的可扩展训练。

提出的方法

  • 该模型采用深度自编码器架构,其中用户嵌入通过应用于用户交互向量的多层感知机(f_λ)学习,随后通过带有逻辑回归似然的重建头(g_θ)进行重建。
  • 通过最小化逻辑回归似然损失来优化负对数似然:-∑ᵢ xᵤ log(g_θ(zᵤ)) - (1 - xᵤ) log(1 - g_θ(zᵤ))。
  • 负采样按小批量进行,仅选择在该小批量中被其他用户交互过的项目,而非完整项目集合中的所有项目。
  • 某项目 i 的采样概率为 P = min(|Uᵢ|/N, 1),其中 N ≈ |U|/m,使得采样偏向于热门项目。
  • 通过输入 dropout 和对编码器与解码器参数同时应用 L2 权重衰减实现正则化。
  • 为提高大批次大小下的内存效率,模型支持将大型稀疏批次切分为更小、更易管理的小批量。

实验结果

研究问题

  • RQ1小批量负采样策略是否能显著减少基于自编码器的协同过滤训练时间,同时不牺牲推荐质量?
  • RQ2仅从同一小批量中其他用户交互过的负样本项中采样,与完整项目集负采样相比,在性能和可扩展性方面有何差异?
  • RQ3非线性自编码器模型在大规模稀疏数据上训练得更快的情况下,其性能在多大程度上能逼近最先进基线模型?
  • RQ4批次大小的选择如何影响负采样偏差以及最终模型的泛化能力?
  • RQ5所提出的方法是否能扩展到极高稀疏度的数据集(例如 0.064% 稀疏度)并保持高效?

主要发现

  • 在所有数据集上,与基线模型相比,该方法在 CPU 上实现了 2.6 倍至 3.32 倍的加速,在 GPU 上实现了 2.1 倍至 3.32 倍的加速。
  • 在 ML-20M 数据集上,模型达到 0.4193 的 NDCG@100,较基线(0.4212)下降 0.45%,性能损失极小。
  • 在 MSD-Large 数据集上,模型达到 0.2945 的 NDCG@100,较基线(0.3059)下降 3.72%,同时在 GPU 上训练速度提升 3.32 倍。
  • 一个 500 名用户的批次的平均输入向量大小从完整项目集的 98,485 降低至 18,740,显著减轻了计算负载。
  • 该模型在所有数据集上均保持一致的性能表现,包括最大规模的 MSD-Large 数据集,表明其对稀疏度增加具有鲁棒性。
  • 交叉验证表明,500 的批次大小为最优选择,因为更小的批次会导致过拟合并使性能在数个周期后下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。