Skip to main content
QUICK REVIEW

[论文解读] Temporal-Logic-Based Reward Shaping for Continuing Reinforcement Learning Tasks

Yuqian Jiang, Suda Bharadwaj|arXiv (Cornell University)|Jul 3, 2020
Reinforcement Learning in Robotics参考文献 24被引用 8
一句话总结

本文提出了强化学习中平均奖励设定下的首个理论奖励塑形框架,通过将领域知识以时序逻辑公式的形式编码,自动转换为塑形函数。该方法在持续任务中确保最优策略恢复的同时加速学习,相较于未塑形和基于屏蔽的基线方法,在样本效率和对错误知识的鲁棒性方面表现更优。

ABSTRACT

In continuing tasks, average-reward reinforcement learning may be a more appropriate problem formulation than the more common discounted reward formulation. As usual, learning an optimal policy in this setting typically requires a large amount of training experiences. Reward shaping is a common approach for incorporating domain knowledge into reinforcement learning in order to speed up convergence to an optimal policy. However, to the best of our knowledge, the theoretical properties of reward shaping have thus far only been established in the discounted setting. This paper presents the first reward shaping framework for average-reward learning and proves that, under standard assumptions, the optimal policy under the original reward function can be recovered. In order to avoid the need for manual construction of the shaping function, we introduce a method for utilizing domain knowledge expressed as a temporal logic formula. The formula is automatically translated to a shaping function that provides additional reward throughout the learning process. We evaluate the proposed method on three continuing tasks. In all cases, shaping speeds up the average-reward learning rate without any reduction in the performance of the learned policy compared to relevant baselines.

研究动机与目标

  • 为解决平均奖励强化学习中缺乏理论奖励塑形框架的问题,该设定相较于折扣奖励更适用于持续任务。
  • 通过允许以直观的时序逻辑公式表达领域知识,消除手动设计势函数的需要。
  • 即使提供的知识不准确,也确保在原始奖励下的最优策略在塑形后仍被保留。
  • 在保持性能的同时提升学习的样本效率,尤其在稀疏奖励或延迟奖励的任务中表现更优。

提出的方法

  • 该框架采用基于势函数的塑形函数 F(s, a, s′) = Φ(s′, a∗) − Φ(s, a),其中 a∗ 是下一状态中使最优 Q 值最大化的动作。
  • 通过证明最优策略的平均奖励在塑形后保持不变,证明了在原始平均奖励 MDP 下的最优策略在该塑形下得以保留。
  • 领域知识以线性时序逻辑(LTL)公式表达,自动转换为塑形函数,无需了解原始奖励的大小。
  • 该方法使用包含表示 LTL 公式的确定性有限自动机(DFA)的产物 MDP 构造,计算安全约束的几乎必然获胜区域。
  • 塑形函数由最优 Q 值和状态-动作势函数推导得出,确保修改后的 MDP 保持相同的最优策略。
  • 该方法在三个持续任务中通过微分 Q 学习进行评估:区域清扫、小车杆控制和网格世界路径规划。

实验结果

研究问题

  • RQ1在平均奖励强化学习设置中,奖励塑形能否获得理论上的合理性,而此前的研究仅集中于折扣奖励?
  • RQ2从时序逻辑公式自动合成塑形函数是否能在平均奖励 MDP 中保留最优策略?
  • RQ3在持续任务中,该方法相较于未塑形和基于屏蔽的基线方法,在样本效率和鲁棒性方面表现如何?
  • RQ4当提供的领域知识不准确时,该方法是否仍能学习到最优策略,而不同于屏蔽等严格执行方法?

主要发现

  • 所提出的奖励塑形框架在原始平均奖励目标下保持了最优策略,其理论证明表明最优策略的平均奖励在塑形后保持不变。
  • 在所有三个评估的持续任务——持续区域清扫、小车杆控制和网格世界路径规划中,该方法相比未塑形的微分 Q 学习实现了更快的学习收敛速度。
  • 当提供的领域知识不准确时,该方法仍能学习到最优策略并优于基线的微分 Q 学习,而屏蔽方法因严格执行错误约束而无法学习到最优策略。
  • 该方法表现出更优的样本效率,显著减少了达到高性能所需的交互次数,尤其在稀疏奖励环境中表现突出。
  • 时序逻辑公式到塑形函数的自动转换消除了手动调整势函数的需要,并避免了对原始奖励大小的依赖。
  • 该框架成功将领域知识的指定(通过 LTL)与学习算法解耦,使非专家也能有效引导探索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。