[论文解读] Preference-based Reinforcement Learning with Finite-Time Guarantees
本文提出 PEPS,这是首个在有限时间内保证找到 ε-最优策略的基于偏好的强化学习算法。它结合了合成奖励估计、双臂赌博机用于探索以及策略搜索,在缺乏真实奖励的情况下,于具有链接函数到隐藏奖励的随机偏好假设下,仍能实现高概率收敛至近似最优策略。
Preference-based Reinforcement Learning (PbRL) replaces reward values in traditional reinforcement learning by preferences to better elicit human opinion on the target objective, especially when numerical reward values are hard to design or interpret. Despite promising results in applications, the theoretical understanding of PbRL is still in its infancy. In this paper, we present the first finite-time analysis for general PbRL problems. We first show that a unique optimal policy may not exist if preferences over trajectories are deterministic for PbRL. If preferences are stochastic, and the preference probability relates to the hidden reward values, we present algorithms for PbRL, both with and without a simulator, that are able to identify the best policy up to accuracy $\varepsilon$ with high probability. Our method explores the state space by navigating to under-explored states, and solves PbRL using a combination of dueling bandits and policy search. Experiments show the efficacy of our method when it is applied to real-world problems.
研究动机与目标
- 为解决基于偏好强化学习(PbRL)中缺乏理论保证的问题,特别是有限时间收敛性问题。
- 开发一种算法,在 PbRL 设置下识别出 ε-最优策略,且无需依赖数值奖励函数。
- 通过避免依赖缓慢的 Q 值估计或昂贵的后验抽样,确保算法的高效性与可扩展性。
- 提供一个通用框架,适用于各种 PbRL 设置,包括有或无模拟器的情形。
- 克服先前方法如 DPS 和 EPMC 的局限性,这些方法存在收敛缓慢和探索能力差的问题。
提出的方法
- 提出一种合成奖励函数,将偏好概率映射为估计奖励,从而在无需直接访问奖励的情况下实现策略优化。
- 使用双臂赌博机算法,通过识别在探索不足状态下的高奖励动作来引导探索。
- 结合偏好反馈与合成奖励估计,应用策略搜索方法迭代优化策略。
- 采用链接函数假设(广义线性偏好),建模偏好概率与隐藏奖励差异之间的关系。
- 设计算法的固定预算变体,以便在样本受限条件下与基线方法进行比较。
- 通过基于可达性的状态选择实现探索,确保覆盖高概率状态。
实验结果
研究问题
- RQ1当偏好为确定性时,在基于偏好的强化学习中是否存在唯一最优策略?
- RQ2在无法访问数值奖励的情况下,能否实现在 PbRL 中对 ε-最优策略的有限时间收敛?
- RQ3如何设计一种高效的 PbRL 探索策略,避免依赖缓慢的 Q 值估计?
- RQ4偏好随机性与链接函数结构对算法性能和样本效率有何影响?
- RQ5能否开发一种 PbRL 算法,在样本效率与策略质量方面均优于现有基线方法如 DPS 和 EPMC?
主要发现
- 当偏好为确定性时,传递性可能不成立,且不存在唯一最优策略——这凸显了采用随机偏好假设的必要性。
- 在广义线性链接函数假设下,PEPS 在有限时间内保证以高概率恢复 ε-最优策略。
- 在网格世界与随机 MDP 环境中,PEPS 在低预算设置及接近确定性偏好(c=0.001)下,优于 DPS 与 EPMC。
- 当 c=0.001 时,PEPS 在几乎所有运行中均恢复了精确最优策略,而 EPMC 随着预算增加仅表现出可忽略的性能提升。
- PEPS 中基于双臂赌博机的探索策略确保了对高可达性状态的有效覆盖,而 DPS 与 EPMC 因 Q 值估计缓慢,探索近乎随机。
- PEPS 实现简单,且具备通用性,可作为子程序集成现有基于值的强化学习与双臂赌博机方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。