[论文解读] Batch-Constrained Distributional Reinforcement Learning for Session-based Recommendation
该论文提出 BCD4Rec,一种用于会话推荐的批量约束分布强化学习方法,仅从离线交互日志中学习,无需在线交互或用户行为模型。通过结合分布强化学习与动作空间约束及预训练物品嵌入,BCD4Rec 在点击率(CTR)和购买率(BR)上显著优于行为策略和强基线模型,同时在大规模动作空间中减少了过估计偏差和流行度偏差。
Most of the existing deep reinforcement learning (RL) approaches for session-based recommendations either rely on costly online interactions with real users, or rely on potentially biased rule-based or data-driven user-behavior models for learning. In this work, we instead focus on learning recommendation policies in the pure batch or offline setting, i.e. learning policies solely from offline historical interaction logs or batch data generated from an unknown and sub-optimal behavior policy, without further access to data from the real-world or user-behavior models. We propose BCD4Rec: Batch-Constrained Distributional RL for Session-based Recommendations. BCD4Rec builds upon the recent advances in batch (offline) RL and distributional RL to learn from offline logs while dealing with the intrinsically stochastic nature of rewards from the users due to varied latent interest preferences (environments). We demonstrate that BCD4Rec significantly improves upon the behavior policy as well as strong RL and non-RL baselines in the batch setting in terms of standard performance metrics like Click Through Rates or Buy Rates. Other useful properties of BCD4Rec include: i. recommending items from the correct latent categories indicating better value estimates despite large action space (of the order of number of items), and ii. overcoming popularity bias in clicked or bought items typically present in the offline logs.
研究动机与目标
- 为解决在线和基于模型的强化学习在会话推荐中的局限性,完全从离线交互日志中学习。
- 缓解离线日志中的过估计偏差和流行度偏差,尤其是在稀疏奖励的大规模动作空间中。
- 开发一种稳健的离线强化学习框架,改进次优行为策略,而无需进一步的用户交互。
- 评估分布强化学习与动作空间约束在改善价值估计和推荐多样性方面的有效性。
- 识别用于批量强化学习超参数调优的可靠离线指标,挑战基于召回率的标准指标的可靠性。
提出的方法
- BCD4Rec 采用分布强化学习来建模 Q 值的完整分布,提高对随机用户反馈的鲁棒性,并减少过估计偏差。
- 通过 BCQ 风格正则化等方式应用批量约束,将学习限制在行为策略支持的动作范围内,减少分布偏移并提高样本效率。
- 利用 SRGNN 的预训练物品嵌入将物品表示在低维空间中,增强大规模动作空间(如约 6.7k 个物品)中的泛化能力。
- 利用离线批量中的验证集计算平均 Q 值估计($\bar{Q}$),结果表明其与在线性能指标(如 CTR 和 BR)具有强相关性。
- 框架整合了约束动作空间训练,引导智能体专注于合理动作,减少对无关物品的错误价值估计。
- 超参数调优基于保留验证集上的 $\bar{Q}$ 进行,实证发现其比标准 Recall@K 更可靠,适用于离线指标选择。
实验结果
研究问题
- RQ1在离线会话推荐中,结合批量约束的分布强化学习是否能优于标准 Q 学习?
- RQ2BCD4Rec 是否能有效减少价值估计中的过估计偏差,特别是针对无关物品类别中的动作?
- RQ3在大规模动作空间中,BCD4Rec 在缓解离线日志中存在的流行度偏差方面效果如何,尤其是在稀疏奖励场景下?
- RQ4平均 Q 值估计($\bar{Q}$)是否比 Recall@K 更可靠,适用于离线强化学习中的超参数选择?
- RQ5在批量强化学习设置下,预训练物品嵌入在高维动作空间中在多大程度上提升了性能?
主要发现
- BCD4Rec 在真实世界和模拟数据集上,显著优于行为策略以及非强化学习和强化学习的强基线模型,在点击率(CTR)和购买率(BR)上均有提升。
- 该方法通过正确地为无关类别物品分配低价值估计,有效减少了过估计偏差,即使在大规模动作空间(约 6.7k 个物品)中亦然。
- 与 DQN、BCQ 和 QRDQN 相比,BCD4Rec 在推荐物品中表现出更低的流行度偏差,其性能接近在线智能体。
- 通过 SRGNN 进行物品嵌入预训练带来了显著的性能提升,尤其在大规模动作空间(如 DN 数据集)中,凸显了表示学习在批量强化学习中的重要性。
- 在保留验证集上计算的平均 Q 值估计($\bar{Q}$)与在线 CTR 和 BR 具有强相关性,其在超参数选择中的表现优于常用的 Recall@3 指标。
- BCD4Rec 在 BR 和 CTR 上均优于标准 DQN 和 QRDQN,且在更大动作空间中性能增益更显著,证实了在离线设置中分布学习与约束机制的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。