Skip to main content
QUICK REVIEW

[论文解读] Candidate Generation with Binary Codes for Large-Scale Top-N Recommendation

Wang-Cheng Kang, Julian McAuley|arXiv (Cornell University)|Sep 12, 2019
Recommender Systems and Techniques参考文献 40被引用 8
一句话总结

本文提出 CIGAR,一种新颖的框架,通过学习的二值编码实现高效候选生成,并利用实值排序模型实现高精度重排序,适用于大规模 Top-N 推荐。通过联合优化用于快速哈希检索的二值嵌入与细粒度重排序,CIGAR 在实现次线性查询时间的同时,达到最先进(SOTA)的准确率,显著提升了可扩展性,且未牺牲性能。

ABSTRACT

Generating the Top-N recommendations from a large corpus is computationally expensive to perform at scale. Candidate generation and re-ranking based approaches are often adopted in industrial settings to alleviate efficiency problems. However it remains to be fully studied how well such schemes approximate complete rankings (or how many candidates are required to achieve a good approximation), or to develop systematic approaches to generate high-quality candidates efficiently. In this paper, we seek to investigate these questions via proposing a candidate generation and re-ranking based framework (CIGAR), which first learns a preference-preserving binary embedding for building a hash table to retrieve candidates, and then learns to re-rank the candidates using real-valued ranking models with a candidate-oriented objective. We perform a comprehensive study on several large-scale real-world datasets consisting of millions of users/items and hundreds of millions of interactions. Our results show that CIGAR significantly boosts the Top-N accuracy against state-of-the-art recommendation models, while reducing the query time by orders of magnitude. We hope that this work could draw more attention to the candidate generation problem in recommender systems.

研究动机与目标

  • 为解决大规模 Top-N 推荐中的可扩展性-效率权衡问题,通过将候选生成与重排序解耦来实现。
  • 通过学习保持偏好的二值编码,在不牺牲排序准确率的前提下提升候选生成效率。
  • 开发一个统一框架,使现有高准确率排序模型能够高效地应用于实时系统。
  • 研究基于候选的采样与重排序如何提升整体推荐质量。
  • 证明通过适当的重排序,二值编码学习可达到甚至超越实值模型的性能。

提出的方法

  • CIGAR 采用两阶段流程:首先,通过 HashRec 学习二值编码,以支持基于哈希表的快速候选检索。
  • HashRec 是一种可微分哈希方法,能够从隐式反馈中学习二值嵌入,保持用户-物品偏好关系在汉明空间中的结构。
  • 通过学习到的二值编码,利用近似最大内积搜索实现候选检索,实现常数或次线性查询时间。
  • 其次,采用候选感知采样策略训练实值排序模型,对检索到的候选进行重排序。
  • 重排序模型使用加权采样策略,在训练过程中优先考虑相关候选,从而更好地对齐最终推荐目标。
  • 整个框架端到端训练,二值编码与重排序模型联合优化,以提升最终 Top-N 准确率。

实验结果

研究问题

  • RQ1学习到的二值编码是否能有效替代启发式或基于规则的候选生成方法,同时保持高准确率?
  • RQ2与标准采样相比,重排序过程中采用基于候选的采样在多大程度上能提升最终推荐质量?
  • RQ3基于二值编码的检索在多大程度上能减少查询时间,同时保持排序性能?
  • RQ4将二值编码检索与实值重排序结合,是否在准确率与效率上均优于纯二值或纯实值模型?
  • RQ5在所提出的框架下,需要多少候选才能实现接近最优的 Top-N 性能?

主要发现

  • CIGAR 在多个大规模数据集(包括 Movielens、Pinterest 和 Flipkart)上实现了最先进(SOTA)的 Top-N 推荐准确率。
  • 与全排序基线相比,该框架将查询时间减少了数量级,实现了真正的实时推理。
  • 在重排序中使用候选感知采样,相比标准采样,NDCG(归一化折损累计增益)性能最高提升 15%。
  • 使用 HashRec 进行二值编码学习,即使在编码长度较短时,也能实现高效检索且准确率损失极小。
  • 二值编码检索与实值重排序的结合,在准确率与效率上均优于纯二值或纯实值模型。
  • 实证结果表明,仅通过二值编码检索 100 个候选即可实现接近最优的性能,证明了其极高的检索效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。