Skip to main content
QUICK REVIEW

[论文解读] Equivalence Between Wasserstein and Value-Aware Loss for Model-based Reinforcement Learning

Kavosh Asadi, Evan Cater|arXiv (Cornell University)|Jun 1, 2018
Reinforcement Learning in Robotics参考文献 16被引用 9
一句话总结

本文建立了基于模型的强化学习中,价值感知模型学习(VAML)与Wasserstein度量之间的理论等价性。通过证明马尔可夫决策过程(MDP)的值函数是Lipschitz连续的,作者表明最小化VAML目标在数学上等价于最小化转移分布之间的Wasserstein距离,为在模型学习中使用Wasserstein度量提供了理论基础。

ABSTRACT

Learning a generative model is a key component of model-based reinforcement learning. Though learning a good model in the tabular setting is a simple task, learning a useful model in the approximate setting is challenging. In this context, an important question is the loss function used for model learning as varying the loss function can have a remarkable impact on effectiveness of planning. Recently Farahmand et al. (2017) proposed a value-aware model learning (VAML) objective that captures the structure of value function during model learning. Using tools from Asadi et al. (2018), we show that minimizing the VAML objective is in fact equivalent to minimizing the Wasserstein metric. This equivalence improves our understanding of value-aware models, and also creates a theoretical foundation for applications of Wasserstein in model-based reinforcement~learning.

研究动机与目标

  • 为解决近似基于模型的强化学习中学习有用模型的挑战,其中标准最大似然目标因误差累积而失效。
  • 理解为何尽管模型存在不准确,价值感知模型学习(VAML)仍能提升规划性能。
  • 建立VAML与通过Wasserstein度量实现最优传输之间的理论联系。
  • 证明最小化VAML等价于最小化值函数Lipschitz连续性下的Wasserstein距离。

提出的方法

  • 通过压缩映射和复合引理,证明在奖励和转移动态有界时,MDP的值函数是Lipschitz连续的。
  • 定义具有有限Lipschitz常数C的Lipschitz函数空间𝒮_C,该常数由奖励和转移动态导出。
  • 将VAML目标重表述为Lipschitz函数上的上确界,表明其等价于Wasserstein度量的Kantorovich-Rubinstein对偶形式。
  • 建立最小化VAML目标等价于最小化真实与预测转移分布之间的Wasserstein距离。
  • 利用该等价性论证,Wasserstein最小化自然促进价值感知模型学习。
  • 提出未来方向,包括使用GAN和熵正则化实现实用的基于Wasserstein的模型学习。

实验结果

研究问题

  • RQ1在标准MDP假设下,MDP的值函数是否为Lipschitz连续?
  • RQ2VAML目标能否与最优传输中的已知度量正式关联?
  • RQ3最小化转移分布之间的Wasserstein距离是否能产生比最大似然估计更有用的规划模型?
  • RQ4在何种条件下,最小化VAML等价于最小化Wasserstein度量?
  • RQ5能否利用VAML与Wasserstein之间的理论等价性设计更优的模型学习算法?

主要发现

  • 在奖励和转移动态有界时,MDP的值函数是Lipschitz连续的,其Lipschitz常数为 C = K^𝒜_d𝒮,dR(R) / (1 - γK_d𝒮,W(T))。
  • VAML目标在数学上等价于对转移分布之间平方Wasserstein距离的最小化,且缩放因子为C²。
  • 最小化VAML目标可确保模型针对下游规划进行优化,因其与值函数结构保持一致。
  • 该等价性为在基于模型的强化学习中使用Wasserstein度量提供了理论依据,因其本质上促进价值感知模型学习。
  • 该结果意味着,任何最小化转移分布之间Wasserstein距离的算法,将隐式最小化最大Bellman误差,从而提升规划性能。
  • 该等价性在值函数为Lipschitz的假设下成立,而该假设在具有有界动态和奖励的标准MDP中已被证明成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。