Skip to main content
QUICK REVIEW

[论文解读] Counterfactual Control for Free from Generative Models

Nicholas Guttenberg, Yen Yu|arXiv (Cornell University)|Feb 22, 2017
Reinforcement Learning in Robotics参考文献 1被引用 3
一句话总结

本文提出一种方法,通过在生成模型的潜在空间中使用梯度下降,从动作-状态轨迹的生成模型中实时推导控制策略,无需微调即可针对任意奖励函数进行优化。关键贡献在于仅通过一个预训练的生成模型,即可实现动态目标适应和反事实规划,实验表明该方法在未直接针对任务进行训练的情况下,成功实现了CartPole中对移动目标的平衡与跟踪。

ABSTRACT

We introduce a method by which a generative model learning the joint distribution between actions and future states can be used to automatically infer a control scheme for any desired reward function, which may be altered on the fly without retraining the model. In this method, the problem of action selection is reduced to one of gradient descent on the latent space of the generative model, with the model itself providing the means of evaluating outcomes and finding the gradient, much like how the reward network in Deep Q-Networks (DQN) provides gradient information for the action generator. Unlike DQN or Actor-Critic, which are conditional models for a specific reward, using a generative model of the full joint distribution permits the reward to be changed on the fly. In addition, the generated futures can be inspected to gain insight in to what the network 'thinks' will happen, and to what went wrong when the outcomes deviate from prediction.

研究动机与目标

  • 开发一种将策略学习与奖励定义解耦的控制框架,以支持动态目标适应。
  • 使智能体能够基于生成模型所构想的反事实未来,进行规划并选择动作。
  • 证明单一生成模型可在无需微调的情况下支持多个未见过的任务的控制。
  • 探索联合建模动作与未来状态是否能比任务特定模型提供更鲁棒、更具泛化能力的控制。

提出的方法

  • 该方法使用循环变分自编码器(RVAE)从交互数据中学习联合分布 $p(future, action | state)$。
  • 通过在RVAE的潜在空间中使用梯度下降进行优化,推导控制策略,以最大化生成的反事实未来的期望奖励函数。
  • 奖励函数直接在生成的未来轨迹上进行评估,梯度通过生成模型反向传播以更新动作序列。
  • 该方法利用完整的联合分布,确保动作-状态序列在内部一致且合理。
  • 模型仅需在环境交互数据上训练一次,之后即可通过潜在空间搜索支持任意奖励函数。
  • 该方法避免训练单独的奖励网络或策略头,而是依赖生成模型的内部动力学进行梯度估计。

实验结果

研究问题

  • RQ1是否可以使用单一动作-状态轨迹生成模型,在不微调的情况下为任意奖励函数推导控制策略?
  • RQ2该模型能否泛化到训练过程中未见过的新任务,例如跟踪移动目标?
  • RQ3该方法对超参数(尤其是潜在空间维度)的敏感性如何?
  • RQ4该模型能否生成内部一致的反事实未来,以支持有效的规划与控制?

主要发现

  • 该模型在125集试验中成功将摆杆保持在原点,证明了通过反事实规划实现的稳定控制。
  • 训练完成后,智能体能够跟随时间变化的目标位置 $x(t) = A\sin(2\pi t/T)$,持续多个振荡周期,尽管该任务未包含在训练目标中。
  • 在移动目标的试验中,智能体可维持平衡长达5000步,平均保持时间超过多种振幅和周期下的一个完整振荡周期。
  • 当周期非常短(T < 250)时性能下降,智能体无法跟踪目标,表明其在时间跟踪速度上存在限制。
  • 潜在空间维度 $N_L$ 是最关键的超参数;空间过大时,由于过度利用不现实的未来预测,导致平衡失败。
  • 该方法平均在100集以内实现任务成功,最快解法在约35集内找到,性能与当前最先进的DQN及基于DQN的智能体相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。