Skip to main content
QUICK REVIEW

[论文解读] Sequential Scenario-Specific Meta Learner for Online Recommendation

Zhengxiao Du, Xiaowei Wang|arXiv (Cornell University)|Jun 2, 2019
Recommender Systems and Techniques参考文献 53被引用 12
一句话总结

本文提出 s2Meta,一种用于少样本元学习的顺序场景特定元学习器,可自动化冷启动推荐场景的训练过程。通过结合模型无关元学习与场景特定适应,s2Meta 通过自适应超参数和早停机制动态控制学习过程,在 Taobao 和 Amazon 等真实世界数据集上实现了最先进性能,相较于基线模型在召回率方面有显著提升。

ABSTRACT

Cold-start problems are long-standing challenges for practical recommendations. Most existing recommendation algorithms rely on extensive observed data and are brittle to recommendation scenarios with few interactions. This paper addresses such problems using few-shot learning and meta learning. Our approach is based on the insight that having a good generalization from a few examples relies on both a generic model initialization and an effective strategy for adapting this model to newly arising tasks. To accomplish this, we combine the scenario-specific learning with a model-agnostic sequential meta-learning and unify them into an integrated end-to-end framework, namely Scenario-specific Sequential Meta learner (or s^2 meta). By doing so, our meta-learner produces a generic initial model through aggregating contextual information from a variety of prediction tasks while effectively adapting to specific tasks by leveraging learning-to-learn knowledge. Extensive experiments on various real-world datasets demonstrate that our proposed model can achieve significant gains over the state-of-the-arts for cold-start problems in online recommendation. Deployment is at the Guess You Like session, the front page of the Mobile Taobao.

研究动机与目标

  • 解决在线推荐中因新场景用户交互数据有限而产生的冷启动问题。
  • 通过仅用少量样本快速适应新推荐场景,减少对大量历史数据的依赖。
  • 通过学习到的元策略,自动化整个训练过程——包括模型初始化、超参数自适应调整以及早停机制。
  • 在短生命周期、低数据量的推荐场景(如限时促销或新品发布)中提升泛化能力,避免过拟合。
  • 最小化在新推荐任务中对人工干预超参数调优和模型训练的需求。

提出的方法

  • 将模型无关元学习与场景特定适应整合到一个端到端框架 s2Meta 中。
  • 利用元学习器通过聚合多样化历史推荐任务的上下文信息,生成通用的模型初始化。
  • 实施包含三个组件的顺序学习过程:元初始化、通过可学习更新控制器进行参数微调,以及通过停止控制器实现的早停。
  • 采用循环神经网络建模顺序决策过程,其中更新控制器和停止控制器分别预测每个训练步骤的输入门和遗忘门。
  • 在历史场景分布上训练元学习器,以学习针对新未见场景的最优适应策略。
  • 采用可微训练目标,以未见任务上的测试性能为优化目标,支持基于梯度的元策略自适应。

实验结果

研究问题

  • RQ1元学习器能否有效初始化并适应新低数据推荐场景下的推荐模型?
  • RQ2自动化超参数自适应与早停机制在冷启动设置下如何提升泛化能力?
  • RQ3在少样本推荐中,顺序性、基于策略的训练过程在多大程度上优于固定或随机的训练调度?
  • RQ4不同推荐模型架构(如交互模块与映射模块)如何与元学习器的自适应策略产生交互?
  • RQ5元学习器能否在包括短生命周期促销活动在内的多样化真实世界推荐场景中实现泛化?

主要发现

  • 在 Amazon 数据集上,s2Meta 实现了 34.39% 的 Recall@10,优于次佳基线 0.83%,优于随机初始化 1.27%。
  • 在 Taobao 数据集上,s2Meta 的交互模块相比映射模块实现了 6.71% 的相对性能提升,表明架构相关性能增益。
  • 移除元初始化(即使用随机初始化)导致性能下降最大,凸显强通用初始点的重要性。
  • 早停策略的影响小于初始化策略,表明元学习器的停止控制器即使在无显式正则化下也能有效防止过拟合。
  • 元学习器学会在不同层和参数上应用不同的更新策略——权重矩阵较早更新,而偏置向量则在后期调整,表明具备分层自适应学习能力。
  • 可视化结果证实,当测试召回率趋于稳定时,停止控制器被激活,与防止过拟合一致,表明泛化能力有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。