[论文解读] Adversarial Soft Advantage Fitting: Imitation Learning without Policy Optimization
该论文提出了一种名为对抗性软优势拟合(Adversarial Soft Advantage Fitting, ASAF)的新颖模仿学习框架,通过训练一个同时依赖于先前策略和可学习策略的结构化判别器,消除了对策略优化的需求。判别器的优化过程可直接导出最优生成器策略,将训练复杂度降低一半,同时在离散与连续控制任务上达到或超越当前最先进方法的性能。
Adversarial Imitation Learning alternates between learning a discriminator -- which tells apart expert's demonstrations from generated ones -- and a generator's policy to produce trajectories that can fool this discriminator. This alternated optimization is known to be delicate in practice since it compounds unstable adversarial training with brittle and sample-inefficient reinforcement learning. We propose to remove the burden of the policy optimization steps by leveraging a novel discriminator formulation. Specifically, our discriminator is explicitly conditioned on two policies: the one from the previous generator's iteration and a learnable policy. When optimized, this discriminator directly learns the optimal generator's policy. Consequently, our discriminator's update solves the generator's optimization problem for free: learning a policy that imitates the expert does not require an additional optimization loop. This formulation effectively cuts by half the implementation and computational burden of Adversarial Imitation Learning algorithms by removing the Reinforcement Learning phase altogether. We show on a variety of tasks that our simpler approach is competitive to prevalent Imitation Learning methods.
研究动机与目标
- 通过消除计算成本高昂且不稳定的策略优化循环,简化对抗性模仿学习。
- 解决传统AIL方法中交替进行对抗训练与强化学习所固有的不稳定性和样本效率低下问题。
- 开发一种可同时学习判别器与生成器策略的方法,从而无需单独的强化学习更新。
- 证明所提方法在显著降低实现与计算开销的前提下,仍能实现具有竞争力的性能。
- 展示该方法在不同轨迹长度的任务中具备泛化能力,包括逐步(transition-wise)与完整轨迹(full-trajectory)设置。
提出的方法
- 提出一种结构化判别器,明确地依赖于两个策略:先前的生成器策略与一个可学习策略。
- 采用最大熵形式,其中判别器使用单个参数化策略来估计专家轨迹与生成轨迹的概率。
- 利用Finn等人提出的最优判别器形式,在判别器训练过程中隐式求解生成器的优化问题。
- 在判别器训练数个周期后,直接将内部策略模型用作生成器策略,完全跳过强化学习过程。
- 引入ASAF-w变体,通过大小为w的滑动窗口处理轨迹,支持逐步模仿学习。
- 为策略与判别器采用共享的神经网络架构,包含卷积层与全连接层,随后通过MLP进行最终预测。
实验结果
研究问题
- RQ1能否通过消除策略优化循环来简化对抗性模仿学习,而不会牺牲性能?
- RQ2一个同时依赖于先前策略与可学习策略的判别器,是否能自然地恢复出最优生成器策略?
- RQ3所提方法是否能在无需任何强化学习更新的前提下,在多样化的控制任务(包括离散与连续)上实现具有竞争力的性能?
- RQ4该方法在不同轨迹长度(包括完整轨迹与逐步学习)上的表现如何?
- RQ5与依赖交替进行强化学习与判别器更新的标准AIL方法相比,该方法是否更具样本效率与稳定性?
主要发现
- ASAF在Hopper、Walker2D、HalfCheetah和Ant等一系列连续控制任务上,性能与当前最先进模仿学习方法(如GAIL + PPO、AIRL + PPO和SQIL)相当或更优。
- 在MuJoCo环境中,ASAF优于BC与SQIL,并在平均回报上与AIRL + PPO和GAIL + PPO持平或超越。
- 在Pommerman随机标签环境中的实验表明,ASAF-32仅用150条专家轨迹即实现了1.0的平均回报,展现出在复杂、部分可观测环境中的强大泛化能力。
- 消融实验表明,ASAF-w在窗口大小w=32时,在部分任务上的表现优于完整轨迹ASAF,表明逐步学习具有优势。
- 超参数搜索显示,ASAF对学习率与窗口大小的变化具有鲁棒性,最佳配置通过在25组设置中进行随机搜索获得。
- 该方法通过消除强化学习循环,将训练复杂度降低,与标准AIL框架相比,实现与计算开销减少约一半。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。