Skip to main content
QUICK REVIEW

[论文解读] Sample-efficient Deep Reinforcement Learning for Dialog Control

Kavosh Asadi, J. D. Williams|arXiv (Cornell University)|Dec 18, 2016
Reinforcement Learning in Robotics参考文献 12被引用 10
一句话总结

本文提出三种基于循环神经网络(RNN)的样本高效深度强化学习方法,用于对话控制。通过引入价值网络以降低策略梯度方差,并对策略网络和价值网络均应用经验回放,该方法相比标准策略梯度方法将所需对话数量减少了约三分之一,在部分可观测对话和完全可观测的Lunar Lander任务中均表现出一致的性能提升。

ABSTRACT

Representing a dialog policy as a recurrent neural network (RNN) is attractive because it handles partial observability, infers a latent representation of state, and can be optimized with supervised learning (SL) or reinforcement learning (RL). For RL, a policy gradient approach is natural, but is sample inefficient. In this paper, we present 3 methods for reducing the number of dialogs required to optimize an RNN-based dialog policy with RL. The key idea is to maintain a second RNN which predicts the value of the current policy, and to apply experience replay to both networks. On two tasks, these methods reduce the number of dialogs/episodes required by about a third, vs. standard policy gradient methods.

研究动机与目标

  • 提升深度强化学习在对话策略优化中的样本效率,其中每次对话交互成本较高。
  • 解决标准策略梯度方法在训练基于RNN的对话策略时存在的高方差与样本低效问题。
  • 通过利用价值函数估计和经验回放,实现使用更少回合训练RNN策略。
  • 在部分可观测对话任务和一个完全可观测的控制任务(Lunar Lander)上评估该方法,以检验其泛化能力。
  • 证明该方法在不同网络架构、优化器和任务类型下仍保持有效性。

提出的方法

  • 引入价值网络 $\hat{V}(\mathbf{h}_t, \mathbf{w})$,用于估计每个隐藏状态 $\mathbf{h}_t$ 的预期回报,作为状态相关的基线,以降低策略更新中的梯度方差。
  • 对策略网络和价值网络均应用经验回放,允许多次梯度更新,从而提升数据效率。
  • 通过重要性采样比率 $\rho_t = \pi(a_t|\mathbf{h}_t)/\mu(a_t|\mathbf{h}_t)$ 实现离策略更新,使经验回放能够适用于行为策略 $\mu$ 产生的非独立同分布数据。
  • 采用双流训练流程:对策略网络进行在线策略更新,对价值网络进行离策略更新,且每个在线策略更新后执行多次离策略更新。
  • 使用随机梯度下降结合自适应优化器(对话任务使用Adadelta,Lunar Lander任务使用Adam),并针对每项任务调整批量大小。
  • 采用循环结构(LSTM或GRU)建模策略和价值函数,以支持在对话场景中处理部分可观测性。

实验结果

研究问题

  • RQ1价值网络是否能降低基于RNN的对话策略在策略梯度训练中的样本复杂度?
  • RQ2当经验回放同时应用于策略网络和价值网络时,其在对话控制中对样本效率的提升程度如何?
  • RQ3该方法在非对话、完全可观测的强化学习任务(如Lunar Lander)上的表现如何,能否体现其泛化潜力?
  • RQ4当改变网络架构、激活函数和优化器时,该方法是否仍能保持性能优势?
  • RQ5与标准在线策略策略梯度方法相比,该方法是否能降低训练方差并加速收敛?

主要发现

  • 在对话控制任务中,与标准在线策略策略梯度方法相比,所提方法将达到渐近性能所需的对话数量减少了约三分之一。
  • 在200次独立运行中,该方法在任务成功率上的方差更低,表明学习过程更加稳定。
  • 在Lunar Lander任务中,该方法同样表现出样本效率的提升,证实了其在不同环境和网络架构下的鲁棒性。
  • 将价值网络作为基线显著降低了梯度方差,从而实现了更快且更稳定的收敛。
  • 经验回放使得每轮对话可进行多次梯度更新,提高了数据效率,减少了对新交互的需求。
  • 该方法在不同优化器(Adadelta与Adam)、激活函数(ReLU)和网络设计下均表现出良好泛化能力,表明其具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。