[论文解读] Large-scale Interactive Recommendation with Tree-structured Policy Gradient
本文提出树状策略梯度推荐(TPGR),一种利用项目上的平衡层次聚类树来建模大规模交互式推荐的强化学习框架,通过将项目选择表述为从根到叶的路径查找,将决策时间复杂度从 O(|A|) 降低至 O(|A|^{1/d})。TPGR 在真实世界数据集上实现了最先进水平的推荐性能,并显著提升了效率。
Reinforcement learning (RL) has recently been introduced to interactive recommender systems (IRS) because of its nature of learning from dynamic interactions and planning for long-run performance. As IRS is always with thousands of items to recommend (i.e., thousands of actions), most existing RL-based methods, however, fail to handle such a large discrete action space problem and thus become inefficient. The existing work that tries to deal with the large discrete action space problem by utilizing the deep deterministic policy gradient framework suffers from the inconsistency between the continuous action representation (the output of the actor network) and the real discrete action. To avoid such inconsistency and achieve high efficiency and recommendation effectiveness, in this paper, we propose a Tree-structured Policy Gradient Recommendation (TPGR) framework, where a balanced hierarchical clustering tree is built over the items and picking an item is formulated as seeking a path from the root to a certain leaf of the tree. Extensive experiments on carefully-designed environments based on two real-world datasets demonstrate that our model provides superior recommendation performance and significant efficiency improvement over state-of-the-art methods.
研究动机与目标
- 为解决现有基于强化学习的交互式推荐系统在处理大规模离散动作空间(如数千个项目)时的低效问题。
- 消除 DDPG 中连续动作表示与真实推荐中离散动作之间的不一致性。
- 设计一种可扩展、高效且有效的策略梯度框架,支持在交互式环境中进行长期规划和动态用户反馈。
- 通过基于真实世界数据集构建的模拟器验证该方法,确保推荐性能与效率的真实评估。
提出的方法
- 在项目上构建一个平衡的层次聚类树,其中从根到叶的每条路径代表一个唯一项目,通过深度 d 将动作空间复杂度降低至 O(|A|^{1/d})。
- 将推荐策略建模为树结构上的随机策略梯度,通过在每一层树节点上顺序选择动作实现高效决策。
- 采用多层策略网络:每个内部节点使用全连接网络输出对子节点的动作概率,最终叶节点对应特定项目。
- 使用两种聚类方法——基于 K-means 和基于 PCA 的方法——构建树结构,确保分区平衡且深度均匀。
- 应用奖励映射函数,将连续奖励转换为 one-hot 向量,以实现稳定的策略梯度更新。
- 引入基于真实世界数据集的模拟器,用于生成用于训练和评估的交互式环境。
实验结果
研究问题
- RQ1树状结构的策略梯度框架能否有效降低交互式推荐中大规模离散动作空间的计算复杂度?
- RQ2所提出的 TPGR 框架是否在推荐准确率和推理效率上均优于现有的 DQN 和 DDPG 方法?
- RQ3项目的层次聚类如何影响交互式环境中所学策略的泛化能力与稳定性?
- RQ4TPGR 框架能否在具有不同项目与用户分布的多样化真实世界数据集中保持高性能?
- RQ5不同的聚类策略(K-means 与 PCA)对最终推荐质量与训练稳定性有何影响?
主要发现
- TPGR 在两个真实世界数据集上相较于最先进方法实现了更优的推荐性能,精度与召回率指标均有显著提升。
- TPGR 的推理时间随项目数量呈亚线性增长,复杂度从 O(|A|) 降低至 O(|A|^{1/d}),当 d 通常设为 2 时,对大规模项目集可实现近乎恒定时间的决策。
- 在高维项目嵌入空间中,基于 K-means 的聚类模块在推荐准确率上优于基于 PCA 的变体。
- 奖励映射函数通过将连续奖励转换为离散 one-hot 向量,有效稳定了策略梯度更新,提升了训练收敛性。
- 大量消融实验表明,层次化树结构与多层策略设计对于效率与性能的提升均至关重要。
- 基于模拟器的评估表明,TPGR 在不同用户交互模式下具有良好的泛化能力,并在不同探索-利用权衡下保持鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。