[论文解读] Off-Policy Reward Shaping with Ensembles
本文提出了一种基于多种启发式方法和缩放因子的策略集成的离策略奖励塑形框架,利用Horde架构实现高效的离策略学习。该集成方法通过动态投票选择表现最佳的策略,超越了单个塑形策略和经过最优调优的组件,无需人工调整启发式方法和缩放参数,同时保持收敛性保证并提升样本效率。
Potential-based reward shaping (PBRS) is an effective and popular technique to speed up reinforcement learning by leveraging domain knowledge. While PBRS is proven to always preserve optimal policies, its effect on learning speed is determined by the quality of its potential function, which, in turn, depends on both the underlying heuristic and the scale. Knowing which heuristic will prove effective requires testing the options beforehand, and determining the appropriate scale requires tuning, both of which introduce additional sample complexity. We formulate a PBRS framework that reduces learning speed, but does not incur extra sample complexity. For this, we propose to simultaneously learn an ensemble of policies, shaped w.r.t. many heuristics and on a range of scales. The target policy is then obtained by voting. The ensemble needs to be able to efficiently and reliably learn off-policy: requirements fulfilled by the recent Horde architecture, which we take as our basis. We demonstrate empirically that (1) our ensemble policy outperforms both the base policy, and its single-heuristic components, and (2) an ensemble over a general range of scales performs at least as well as one with optimally tuned components.
研究动机与目标
- 解决基于势函数的奖励塑形(PBRS)中因启发式选择和缩放参数调优带来的高样本复杂度问题。
- 在探索无法被引导的潜在离策略设置中实现有效的奖励塑形。
- 开发一种利用多种启发式方法进行奖励塑形的框架,而无需事先知晓其有效性或最优缩放比例。
- 通过基于Horde架构的离策略学习保证,确保收敛性和计算效率。
- 证明集成投票机制可超越单个塑形策略及最优调优的组件。
提出的方法
- 使用相同的训练经验数据,训练一组策略,每个策略均采用不同的势函数,分别基于不同的启发式方法和缩放因子进行塑形。
- 以Horde架构作为底层的离策略学习引擎,确保在固定行为策略下的收敛性。
- 应用投票机制将集成成员合并为单一目标策略,基于集体表现选择动作。
- 在所有智能体之间共享参数集,以降低计算开销,同时支持高效的离策略学习。
- 在广泛的缩放因子范围(1 到 10⁴)内评估性能,以检验鲁棒性并消除超参数调优的需要。
- 在100次独立运行中,每50个训练周期进行一次评估,以确保基准环境中的统计可靠性。
实验结果
研究问题
- RQ1在不引入额外样本复杂度的前提下,使用多种启发式方法和缩放因子的策略集成是否能超越单一塑形策略?
- RQ2该集成框架是否在行为策略固定、探索不可控的潜在离策略设置中保持收敛性保证?
- RQ3该集成能否在无需预先调优的情况下,动态识别并遵循最有效的启发式方法和缩放因子?
- RQ4当集成使用广泛范围的缩放因子时,其性能与使用一组最优调优组件的性能相比如何?
- RQ5在多个塑形策略之间进行投票,是否能提升学习速度,相比依赖最优单个组件?
主要发现
- 全局集成 $E_C$ 超过了基础学习器和所有单个塑形组件,证明了结合多种启发式方法和缩放因子的有效性。
- 集成性能与 $E^1_C$(表现最佳的单启发式集成)相当,表明其成功识别并利用了最有效的启发式方法。
- 在广泛缩放因子范围内进行的集成,其性能至少与最优调优组件相当,消除了对超参数预调优的需求。
- $E_C$ 的性能在长期中与更优的首次塑形($ heta_1$)保持一致,表明投票机制正确优先选择了更优的启发式方法。
- 集成始终优于其各组件的平均性能,表明集体决策机制可提升学习效果,超越个体贡献。
- 该框架成功实现了在潜在离策略设置下的有效PBRS,验证了其在高失败成本现实应用中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。