Skip to main content
QUICK REVIEW

[论文解读] ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor

Wanqi Xue, Qingpeng Cai|arXiv (Cornell University)|Jun 1, 2022
Recommender Systems and Techniques被引用 6
一句话总结

ResAct 提出了一种强化学习框架,通过学习一个接近但优于当前在线部署策略的策略,从而在避免昂贵在线交互的前提下,提升序列推荐中的长期参与度。它使用残差智能体来优化行为重建,并引入信息论正则化项以增强特征的表达能力与简洁性,从而在基准数据集和工业数据集上均达到最先进性能。

ABSTRACT

Long-term engagement is preferred over immediate engagement in sequential recommendation as it directly affects product operational metrics such as daily active users (DAUs) and dwell time. Meanwhile, reinforcement learning (RL) is widely regarded as a promising framework for optimizing long-term engagement in sequential recommendation. However, due to expensive online interactions, it is very difficult for RL algorithms to perform state-action value estimation, exploration and feature extraction when optimizing long-term engagement. In this paper, we propose ResAct which seeks a policy that is close to, but better than, the online-serving policy. In this way, we can collect sufficient data near the learned policy so that state-action values can be properly estimated, and there is no need to perform online exploration. ResAct optimizes the policy by first reconstructing the online behaviors and then improving it via a Residual Actor. To extract long-term information, ResAct utilizes two information-theoretical regularizers to confirm the expressiveness and conciseness of features. We conduct experiments on a benchmark dataset and a large-scale industrial dataset which consists of tens of millions of recommendation requests. Experimental results show that our method significantly outperforms the state-of-the-art baselines in various long-term engagement optimization tasks.

研究动机与目标

  • 为解决序列推荐中长期用户参与度优化的挑战,该挑战对 DAU 和停留时长等指标至关重要。
  • 克服强化学习在真实系统中的局限性,包括稀疏奖励、高探索成本以及长期信用分配问题。
  • 在不进行在线交互的前提下,学习一个优于当前在线服务策略的改进策略,且操作接近现有策略。
  • 通过信息论正则化,确保特征表示兼具表达能力与简洁性,以增强长期参与度的特征表征能力。
  • 在基准数据集与大规模工业数据集上验证所提方法的有效性。

提出的方法

  • ResAct 利用历史数据重建在线服务策略的行为,构建监督预训练阶段。
  • 引入残差智能体,学习在重建策略基础上进行改进,实现无需完整在线交互的局部策略优化。
  • 采用两种信息论正则化项:其一用于最大化隐藏状态与用户历史之间的互信息(表达能力),其二用于最小化表示中的冗余性(简洁性)。
  • 将复杂的策略优化问题分解为两个子任务:行为重建与残差策略改进,从而简化训练过程。
  • 通过在重建数据上端到端使用监督学习进行训练,避免在线探索与奖励稀疏性问题。
  • 模型在 MovieLens-1m 与包含数千万请求的大规模工业数据集上进行评估。

实验结果

研究问题

  • RQ1能否在不依赖在线交互的前提下,学习到一个接近但优于当前在线服务策略的策略?
  • RQ2当奖励稀疏且延迟时,如何优化长期参与度?
  • RQ3特征表达能力与简洁性在提升长期推荐性能方面发挥何种作用?
  • RQ4信息论正则化项能否有效增强序列推荐中的表征学习?
  • RQ5残差智能体机制在长期参与度任务中是否优于直接策略学习?

主要发现

  • ResAct 在 MovieLens-1m 基准数据集与大规模工业 RecL-25m 数据集上的长期参与度优化任务中,显著优于当前最先进基线方法。
  • 在 RecL-25m 数据集上,ResAct 相较最强基线,实现了会话长度 7.3% 的相对提升与回访时间 12.1% 的提升。
  • 消融实验表明,若移除表达能力或简洁性正则化项,性能均出现显著下降,证实二者均具关键作用。
  • 同时移除两项正则化项的性能下降程度小于仅移除其中一项,表明表达能力与简洁性之间存在协同效应。
  • 残差智能体机制实现了有效的局部策略改进,其性能优于在整个策略空间中进行的完整策略优化。
  • 该方法无需在线交互即可实现优异性能,具备工业部署的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。