Skip to main content
QUICK REVIEW

[论文解读] Reward Constrained Interactive Recommendation with Natural Language Feedback

Ruiyi Zhang, Tong Yu|arXiv (Cornell University)|May 4, 2020
Recommender Systems and Techniques参考文献 50被引用 5
一句话总结

本文提出了一种用于文本交互式推荐的奖励约束强化学习框架,通过对抗性训练的判别器动态检测过去自然语言反馈中的违规行为,以强制执行用户偏好。该方法在推荐和文本生成任务中均提升了推荐质量与收敛速度,相较于标准强化学习和简单约束基线,实现了稳定提升。

ABSTRACT

Text-based interactive recommendation provides richer user feedback and has demonstrated advantages over traditional interactive recommender systems. However, recommendations can easily violate preferences of users from their past natural-language feedback, since the recommender needs to explore new items for further improvement. To alleviate this issue, we propose a novel constraint-augmented reinforcement learning (RL) framework to efficiently incorporate user preferences over time. Specifically, we leverage a discriminator to detect recommendations violating user historical preference, which is incorporated into the standard RL objective of maximizing expected cumulative future rewards. Our proposed framework is general and is further extended to the task of constrained text generation. Empirical results show that the proposed method yields consistent improvement relative to standard RL methods.

研究动机与目标

  • 为解决推荐系统在探索过程中违反用户通过自然语言反馈表达的偏好的挑战。
  • 开发一种通用的、通过约束增强的强化学习框架,能够动态整合用户反馈,而无需依赖显式的硬编码约束。
  • 通过对抗性训练学习可泛化的约束,提升交互式推荐与文本生成任务中的收敛速度与性能。
  • 在推荐与文本生成任务上验证该框架,证明其鲁棒性与泛化能力。

提出的方法

  • 将基于文本的交互式推荐建模为约束马尔可夫决策过程(CMDP),其中约束代表来自过去自然语言反馈的用户偏好。
  • 采用对抗性训练的判别器网络,检测违反先前表达的用户偏好的推荐结果,作为动态约束评判器。
  • 将判别器的输出作为惩罚项整合进强化学习目标,通过拉格朗日松弛方法实现端到端训练。
  • 采用双重优化过程:策略学习以最大化累积奖励,判别器训练以识别约束违规。
  • 通过在情感或内容属性上定义约束,将该框架扩展至约束性文本生成任务,并使用预训练分类器作为约束函数。
  • 在真实世界数据集(如Yelp用于文本生成,视觉推荐数据集)上应用该方法,通过策略梯度方法进行训练并进行超参数调优。

实验结果

研究问题

  • RQ1对抗性训练的判别器能否有效检测出违反用户以自然语言表达偏好的推荐?
  • RQ2与标准强化学习或简单硬约束相比,引入动态学习的约束是否能提升交互式推荐中的性能与收敛速度?
  • RQ3所提出的框架能否泛化至其他序列生成任务,例如具有情感控制的约束性文本生成?
  • RQ4学习到的拉格朗日乘子λ在训练过程中如何演变?其变化揭示了何种约束违规动态特征?

主要发现

  • RCR框架在多个推荐指标(包括命中率与平均倒数排名)上,相较于标准强化学习和简单约束基线,均实现了稳定性能提升。
  • 在前40,000次训练迭代中,RCR的收敛速度显著快于标准强化学习,如图4所示的学习曲线所示。
  • 学习到的拉格朗日乘子λ在初始峰值后稳定在λ = 0.04,表明其能有效动态调节约束违规频率。
  • 在Yelp文本生成任务中,RCR将违规率从标准强化学习的40.36%降低至10.49%,同时提升测试BLEU分数(例如BLEU-2从0.807提升至0.840)。
  • 表3中的生成文本示例显示,RCR生成的评论更具连贯性且情感为正向,同时避免了负面情感,证明了约束的有效执行。
  • 判别器-based约束比硬编码属性匹配泛化能力更强,表现为RCR与简单约束基线之间性能差距更大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。