[论文解读] Multi-task Maximum Entropy Inverse Reinforcement Learning
本文提出了一种正则化的最大因果熵逆强化学习(MCE-IRL)框架,用于多任务 IRL,通过利用任务间的共享奖励结构来提升样本效率。该方法在网格世界环境中实现了单次演示模仿学习,而单任务 MCE-IRL 则需要数百次演示;同时探索了函数逼近器的元学习扩展,揭示了对抗式 IRL 在多模态策略下存在的局限性。
Multi-task Inverse Reinforcement Learning (IRL) is the problem of inferring multiple reward functions from expert demonstrations. Prior work, built on Bayesian IRL, is unable to scale to complex environments due to computational constraints. This paper contributes a formulation of multi-task IRL in the more computationally efficient Maximum Causal Entropy (MCE) IRL framework. Experiments show our approach can perform one-shot imitation learning in a gridworld environment that single-task IRL algorithms need hundreds of demonstrations to solve. We outline preliminary work using meta-learning to extend our method to the function approximator setting of modern MCE IRL algorithms. Evaluating on multi-task variants of common simulated robotics benchmarks, we discover serious limitations of these IRL algorithms, and conclude with suggestions for further work.
研究动机与目标
- 解决在多个奖励函数需从相似任务中推断的多任务设置下,单任务逆强化学习(IRL)存在的样本效率低下问题。
- 通过采用计算高效的最大因果熵(MCE)IRL 框架,克服贝叶斯 IRL 在高维连续状态空间中的可扩展性限制。
- 通过一种正则化的 MCE-IRL 公式联合推断多个奖励函数,利用任务间的结构相似性来提升样本效率。
- 通过元学习将方法扩展至函数逼近器设置,旨在仅用少量演示即可泛化到新任务。
- 研究对抗式 IRL 在多任务连续控制基准中的表现,识别出与多模态专家策略相关的根本性局限。
提出的方法
- 在最大因果熵 IRL 框架内构建多任务 IRL,通过在损失函数中添加正则化项,鼓励任务特定奖励函数之间的相似性。
- 采用线性函数逼近奖励:$ R(s,a) = \theta^T F(s,a) $,其中 $ \theta $ 为奖励权重向量,$ F(s,a) $ 为状态-动作特征。
- 使用基于梯度的方法优化正则化的 MCE-IRL 目标,推断与专家演示一致的奖励函数,同时促进任务间的泛化。
- 通过元学习应用于对抗式 IRL(AIRL),训练奖励网络(判别器)的元初始化,使得在新任务上进行少量样本微调即可获得有效策略。
- 使用 Reptile 基元学习方法在任务间更新奖励网络参数,实现在极少演示下快速适应新环境。
- 在离散网格世界和连续控制基准(如 MountainCarContinuous-v0)上进行评估,比较固定与可变目标配置下的性能表现。
实验结果
研究问题
- RQ1正则化的 MCE-IRL 是否能在单次演示下实现多任务环境中的模仿学习,而单任务 MCE-IRL 则需要数百次演示?
- RQ2在多任务连续控制环境中,元学习的对抗式 IRL 与单任务 AIRL 在单峰与多峰专家策略下的性能表现如何比较?
- RQ3对抗式 IRL 在多任务设置中存在哪些局限性,特别是在专家策略为多模态时?
- RQ4元学习在函数逼近器基 IRL 框架中能在多大程度上提升对新任务的泛化能力?
- RQ5对抗式 IRL 在多模态环境中的失败是否类似于生成对抗网络(GAN)中的模式崩溃?近期 GAN 训练技术能否稳定 IRL 训练?
主要发现
- 正则化的 MCE-IRL 方法在 $9 \times 9$ 网格世界中实现了单次演示模仿学习,仅需一次演示即可恢复接近最优的策略,而单任务 MCE-IRL 则需要数百次演示。
- 在 MountainCarContinuous-v0 的固定测试场景中,单任务 AIRL 和元学习 AIRL 均达到接近最优性能,因为最优策略为单峰且可从少量轨迹中轻松泛化。
- 在可变测试场景中,目标标志位置随机化且专家策略为双峰时,单任务 AIRL 即使在 100 次演示后仍无法学习到良好策略,表明其对多模态行为的泛化能力差。
- 元学习 AIRL 在可变测试场景中也失败,原因在于底层对抗式 IRL 算法的不稳定性,其在处理多模态专家策略时表现困难。
- 本研究发现,对抗式 IRL 在多模态环境中存在根本性局限,可能与 GAN 中的模式崩溃类似,即判别器无法捕捉多种最优行为模式。
- 作者得出结论:当前的对抗式 IRL 方法不适用于具有多模态专家策略的任务,建议未来工作探索受 GAN 训练进展(如梯度回溯或变分学习)启发的改进训练动态。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。