Skip to main content
QUICK REVIEW

[论文解读] Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction

Hongyao Tang, Jianye Hao|arXiv (Cornell University)|May 27, 2019
Financial Markets and Investment Strategies参考文献 32被引用 3
一句话总结

该论文提出了一种基于未来预测的价值函数分解方法(VDFP),一种深度强化学习算法,通过未来轨迹预测将价值函数分解为独立的动力学与回报两部分。通过使用条件变分自编码器(VAE)进行动力学建模,并采用凸回报头,VDFP在MuJoCo连续控制任务中实现了最先进(SOTA)的性能表现,尤其在延迟奖励设置下表现优异,其最终回报相较DDPG提升了2至4倍。

ABSTRACT

Value functions are crucial for model-free Reinforcement Learning (RL) to obtain a policy implicitly or guide the policy updates. Value estimation heavily depends on the stochasticity of environmental dynamics and the quality of reward signals. In this paper, we propose a two-step understanding of value estimation from the perspective of future prediction, through decomposing the value function into a reward-independent future dynamics part and a policy-independent trajectory return part. We then derive a practical deep RL algorithm from the above decomposition, consisting of a convolutional trajectory representation model, a conditional variational dynamics model to predict the expected representation of future trajectory and a convex trajectory return model that maps a trajectory representation to its return. Our algorithm is evaluated in MuJoCo continuous control tasks and shows superior results under both common settings and delayed reward settings.

研究动机与目标

  • 为解决价值函数估计中环境动力学与奖励信号纠缠的问题,该问题在随机环境和延迟奖励环境中会降低性能。
  • 开发一种无模型强化学习算法,将价值估计解耦为两个独立且可学习的组件:未来动力学预测与轨迹回报估计。
  • 通过独立训练动力学与回报模型,提升在延迟奖励等挑战性设置下的样本效率与鲁棒性。
  • 提出一种基于未来预测的新理论与实践框架,用于价值函数估计,其灵感来源于人类认知过程。
  • 在标准MuJoCo基准上对方法进行实证验证,并通过消融实验确保可复现性与深入洞察。

提出的方法

  • 将价值函数重新表达为与奖励无关的预测性动力学函数与与策略无关的轨迹回报函数的组合。
  • 使用卷积神经网络将轨迹编码为紧凑表示,以供下游建模使用。
  • 采用条件变分自编码器(VAE)建模未来轨迹表示的分布,通过截断生成噪声来近似期望的未来状态-动作轨迹。
  • 动力学模型被训练以预测期望的未来表示,且与奖励信号完全解耦。
  • 采用凸轨迹回报模型将轨迹表示映射到其折扣累积回报,该模型独立于动力学模型进行训练。
  • 整体算法采用离策略训练与经验回放机制,利用解耦组件实现稳定且高效的训练。

实验结果

研究问题

  • RQ1能否通过未来预测有效将价值函数估计分解为独立的动力学与回报两部分?
  • RQ2将动力学与回报建模解耦是否能提升在具有随机动力学或延迟奖励环境中的学习稳定性与性能?
  • RQ3使用截断噪声生成的条件VAE能否有效建模期望的未来轨迹,同时对奖励信号的不规则性保持鲁棒性?
  • RQ4在标准与延迟奖励的MuJoCo环境中,该方法相较于现有SOTA算法表现如何?
  • RQ5各组件(动力学、回报、表示)对整体性能的贡献如何?该方法在分布偏移下的鲁棒性如何?

主要发现

  • 在标准训练设置下,VDFP在HalfCheetah-v1上的最终回报达到5818.60 ± 336.25,优于DDPG及其他基线方法。
  • 在16步延迟奖励设置下,VDFP在HalfCheetah-v1上的最终回报为5712.55 ± 233.74,相较DDPG的最终性能提升超过2倍。
  • 在128步延迟设置下,VDFP在HalfCheetah-v1上仍保持4752.84 ± 328.75的回报,表现出强鲁棒性,而DDSR则未能有效学习。
  • 消融实验表明,移除条件VAE或凸回报模型会显著降低性能,证实了两个组件的关键作用。
  • 在所有测试环境(包括Walker2d-v1与Hopper-v1)中,该方法在学习速度与最终性能上均表现出一致的优越性。
  • 离策略训练未导致性能下降,表明确定性策略与解耦架构有效缓解了对策略的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。