Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads

Ji He, Mari Ostendorf|arXiv (Cornell University)|Jun 12, 2016
Hate Speech and Cyberbullying Detection参考文献 37被引用 9
一句话总结

该论文提出了一种深度强化学习框架,用于通过由自然语言评论组成的组合动作空间来预测和追踪热门Reddit帖子。通过使用双向LSTM对子动作之间的相互依赖关系进行建模,DRRN-BiLSTM架构在不同推荐数量下均表现出更优的性能和泛化能力,在平均karma得分和对请求大小变化的鲁棒性方面均优于基线模型。

ABSTRACT

We introduce an online popularity prediction and tracking task as a benchmark task for reinforcement learning with a combinatorial, natural language action space. A specified number of discussion threads predicted to be popular are recommended, chosen from a fixed window of recent comments to track. Novel deep reinforcement learning architectures are studied for effective modeling of the value function associated with actions comprised of interdependent sub-actions. The proposed model, which represents dependence between sub-actions through a bi-directional LSTM, gives the best performance across different experimental configurations and domains, and it also generalizes well with varying numbers of recommendation requests.

研究动机与目标

  • 开发一个用于社交媒体趋势识别的强化学习基准任务,使用自然语言状态和组合动作。
  • 解决在组合动作空间中对子动作(评论)之间相互依赖关系进行建模的挑战,以实现长期流行度预测。
  • 设计能够有效估计一组相互依赖的自然语言动作的Q值的深度Q-learning架构。
  • 在不重新训练的情况下,评估模型在不同推荐帖子数量(K)下的泛化能力。
  • 研究对评论之间冗余性和时序依赖性的建模对预测性能的影响。

提出的方法

  • 将流行度预测建模为一个序列决策问题,其中动作是从最近帖子固定窗口中选择的评论集合。
  • 提出一种新型深度Q网络架构——DRRN-BiLSTM,利用双向LSTM对动作集中子动作(评论)之间的依赖关系进行编码。
  • 通过双向上下文建模,模型计算子动作的联合效用表示,以捕捉冗余性和相互依赖性。
  • 通过经验回放和目标网络进行深度Q-learning训练,使用karma得分作为稀疏且延迟的奖励信号。
  • 基线模型包括线性动作价值估计、PA-DQN和DRRN-Sum(子动作的平均池化),用于对比评估。
  • 在多个子版块(如r/askscience)的Reddit数据上对系统进行评估,性能通过相对于基线的平均karma得分增益来衡量。

实验结果

研究问题

  • RQ1深度强化学习模型是否能仅通过自然语言状态和动作有效预测并追踪热门Reddit帖子?
  • RQ2双向LSTM在组合动作空间中是否能有效捕捉子动作(评论)之间的相互依赖关系?
  • RQ3所提出的模型是否能在不重新训练的情况下泛化到不同数量的推荐帖子(K)?
  • RQ4对子动作冗余性的建模如何影响对组合动作集的估计价值?
  • RQ5在延迟反馈条件下,该模型是否能优于线性和标准DQN基线模型,在长期流行度预测中表现更优?

主要发现

  • DRRN-BiLSTM模型在多个子版块和实验设置下,始终在平均karma得分增益方面优于所有基线模型。
  • 在r/askscience上,当N=10且K=3时,DRRN-BiLSTM的平均karma增益达到829.9,显著高于线性基线(538.5)和PA-DQN。
  • 该模型泛化能力出色:当在K=3上训练并在K=2,4,5上测试时,其性能仍优于为每个K值专门训练的基线模型。
  • 在一个高度冗余的示例中,DRRN-BiLSTM预测的行动值相比DRRN-Sum高出26%的相对增幅,而DRRN-Sum的增幅为86%,表明其对子动作依赖关系的建模更优。
  • 双向LSTM组件有效捕捉了评论之间的相互依赖关系,降低了冗余性的影响,从而提升了价值估计的准确性。
  • 该框架在不同文本类型和子版块风格间具有良好的泛化能力,如在语言和karma分布各异的多样化子版块中均表现出一致的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。