[论文解读] Efficient Exploration of Reward Functions in Inverse Reinforcement Learning via Bayesian Optimization
该论文提出 BO-IRL,一种用于逆强化学习的贝叶斯优化框架,通过引入一种新颖的 $ρ$-投影来高效探索奖励函数空间,以处理策略不变性问题。通过将等价的奖励函数映射到潜在空间中的单一点,BO-IRL 实现了对标准平稳核的有效利用,减少了昂贵的策略优化次数,同时以高样本效率发现多个一致的奖励函数。
The problem of inverse reinforcement learning (IRL) is relevant to a variety of tasks including value alignment and robot learning from demonstration. Despite significant algorithmic contributions in recent years, IRL remains an ill-posed problem at its core; multiple reward functions coincide with the observed behavior and the actual reward function is not identifiable without prior knowledge or supplementary information. This paper presents an IRL framework called Bayesian optimization-IRL (BO-IRL) which identifies multiple solutions that are consistent with the expert demonstrations by efficiently exploring the reward function space. BO-IRL achieves this by utilizing Bayesian Optimization along with our newly proposed kernel that (a) projects the parameters of policy invariant reward functions to a single point in a latent space and (b) ensures nearby points in the latent space correspond to reward functions yielding similar likelihoods. This projection allows the use of standard stationary kernels in the latent space to capture the correlations present across the reward function space. Empirical results on synthetic and real-world environments (model-free and model-based) show that BO-IRL discovers multiple reward functions while minimizing the number of expensive exact policy optimizations.
研究动机与目标
- 为解决逆强化学习中奖励函数不唯一的问题,即多个奖励函数可产生相同的专家行为。
- 通过利用贝叶斯优化降低 IRL 中精确策略优化的计算成本。
- 通过使用新型核函数对奖励函数之间的相关性进行建模,实现在奖励函数空间中的高效探索。
- 提供一种方法,发现多个合理的奖励函数,而非收敛于单一解。
- 通过奖励函数上的高斯过程后验提供不确定性估计,支持下游分析。
提出的方法
- 提出一种 $ρ$-投影,将策略不变的奖励函数映射到潜在空间中的单一点,确保结构不变性得以保留。
- 设计一种 $ρ$-RBF 核函数,利用潜在空间对具有相似似然性的奖励函数之间的相关性进行建模。
- 应用贝叶斯优化以最小化专家演示的负对数似然(NLL),使用高斯过程对 NLL 景观进行建模。
- 利用 GP 后验估计 NLL 的不确定性,从而支持主动学习并迭代优化候选奖励函数。
- 仅在必要时调用策略优化子程序,通过战略性地选择有前景的奖励函数参数,最小化昂贵的评估次数。
- 在合成环境和真实世界环境(包括无模型和有模型设置)中验证该方法,以证明其样本效率和鲁棒性。
实验结果
研究问题
- RQ1尽管存在非平稳性和策略不变性奖励函数空间的挑战,贝叶斯优化能否在逆强化学习中有效应用?
- RQ2如何对策略不变性(即不同奖励函数产生相同最优策略)进行建模,以改善基于核函数的奖励函数空间泛化能力?
- RQ3通过 $ρ$-投影学习得到的潜在表示,能否使标准平稳核(如 RBF)更有效地捕捉奖励函数之间的相关性,相较于标准核函数?
- RQ4与最先进 IRL 方法相比,BO-IRL 在多大程度上减少了昂贵的策略优化调用次数?
- RQ5BO-IRL 在多种环境中发现多个与专家行为一致的奖励函数的能力如何?
主要发现
- 在 Gridworld 环境中,使用 $ρ$-RBF 核函数的 BO-IRL 仅用 16.0 ± 15.6 次迭代便实现了 70% 的成功率,显著优于标准 RBF 核函数(50% 成功率,30.0 ± 34.4 次迭代)。
- 在 Börlange 道路网络中,BO-IRL 仅用 2.0 ± 1.1 次迭代便达到 100% 成功率,而使用 RBF 核函数的对比方法需 9.5 ± 6.3 次迭代才实现 80% 成功率。
- 在离散控制和连续控制任务中,BO-IRL 均发现了与专家演示一致的多个奖励函数,包括 Fetch-Reach 环境。
- 该方法通过利用不确定性感知的贝叶斯优化,减少了精确策略优化的次数,在样本效率上优于 BIRL、AIRL 和 GCL。
- 实验表明,标准核函数因策略不变性而无法捕捉奖励函数之间的相关性,而 $ρ$-RBF 核函数能有效建模这些结构。
- 在 Fetch-Reach 任务中,BO-IRL 在第 90 次迭代时识别出具有较大距离阈值(蓝色球体)的奖励函数,展示了其发现具有行为一致性的有意义解的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。