Skip to main content
QUICK REVIEW

[论文解读] Surprising Negative Results for Generative Adversarial Tree Search

Kamyar Azizzadenesheli, Brandon Yang|arXiv (Cornell University)|Jun 15, 2018
Reinforcement Learning in Robotics参考文献 47被引用 14
一句话总结

该论文提出生成对抗树搜索(GATS),一种基于模型的深度强化学习算法,利用基于生成对抗网络(GAN)的动力学模型生成环境轨迹,并结合DQN进行价值估计,执行有限深度的蒙特卡洛树搜索(MCTS)。令人意外的是,尽管在偏差-方差控制和样本效率方面具有理论优势,GATS在Atari环境中的表现仍未能超越标准DQN,暴露出使用学习生成模型进行有限深度MCTS时存在关键局限性。

ABSTRACT

While many recent advances in deep reinforcement learning (RL) rely on model-free methods, model-based approaches remain an alluring prospect for their potential to exploit unsupervised data to learn environment model. In this work, we provide an extensive study on the design of deep generative models for RL environments and propose a sample efficient and robust method to learn the model of Atari environments. We deploy this model and propose generative adversarial tree search (GATS) a deep RL algorithm that learns the environment model and implements Monte Carlo tree search (MCTS) on the learned model for planning. While MCTS on the learned model is computationally expensive, similar to AlphaGo, GATS follows depth limited MCTS. GATS employs deep Q network (DQN) and learns a Q-function to assign values to the leaves of the tree in MCTS. We theoretical analyze GATS vis-a-vis the bias-variance trade-off and show GATS is able to mitigate the worst-case error in the Q-estimate. While we were expecting GATS to enjoy a better sample complexity and faster converges to better policies, surprisingly, GATS fails to outperform DQN. We provide a study on which we show why depth limited MCTS fails to perform desirably.

研究动机与目标

  • 设计一种样本高效、鲁棒的基于模型的强化学习算法,利用深度生成模型在Atari环境中实现性能提升。
  • 探究生成对抗树搜索(GATS)是否能在样本效率和最终策略性能方面超越无模型DQN。
  • 分析MCTS中Q值估计的偏差-方差权衡,并评估其对规划质量的影响。
  • 评估生成动力学模型(GDM)在Atari学习环境(ALE)中不同游戏模式和难度下的泛化能力与领域自适应能力。
  • 理解为何在复杂环境中,使用学习模型的有限深度MCTS未能实现预期的性能提升。

提出的方法

  • GATS采用基于条件pix2pix GAN、Wasserstein损失和谱归一化的生成动力学模型(GDM),从状态-动作对生成高保真度的后续帧。
  • 奖励预测器(RP)对截断后的奖励[-1, 0, 1]进行分类,以实现在生成轨迹中的奖励估计。
  • 使用真实环境转移数据训练DQN或DDQN网络,以估计MCTS中叶节点的Q值,同时通过在生成帧上微调第二个Q网络,实现真实与生成状态间Q值的一致性。
  • GATS利用GDM进行轨迹生成,结合Q网络进行值分配,执行有限深度的MCTS,树搜索由置信上界(UCB)引导。
  • GDM在真实转移数据上进行训练,并通过自生成样本进一步微调,以将轨迹扩展至10步以上,同时保持准确性。
  • 通过将GDM从一种游戏模式/难度迁移到另一种,评估其领域自适应能力,性能通过L1/L2损失和生成帧的定性分析进行衡量。

实验结果

研究问题

  • RQ1基于GAN的生成动力学模型是否能通过MCTS实现在Atari环境中的有效且样本高效的规划?
  • RQ2GATS是否在基于模型的强化学习中实现了比标准DQN更优的样本复杂度和更快的收敛速度?
  • RQ3为何尽管在偏差-方差控制方面具有理论优势,使用学习生成模型的有限深度MCTS仍未能超越无模型DQN?
  • RQ4GDM在ALE中不同游戏模式和难度下的泛化能力如何?其在领域自适应中的样本效率如何?
  • RQ5在生成帧上的Q值估计与真实帧上的Q值估计在多大程度上保持一致?这种一致性如何影响MCTS性能?

主要发现

  • 尽管理论上预期具有更高的样本效率和更低的Q值估计偏差,GATS在所有测试的Atari环境中均未能超越标准DQN。
  • 在领域自适应过程中,GDM在训练集和测试集上均实现了较低的L1和L2损失,但定性分析表明,当从零开始训练时,其无法准确捕捉Pong中球的运动轨迹等关键动力学特征。
  • GDM能有效泛化至新的游戏模式和难度,仅需数千个样本即可适应——远少于Q网络所需的数量级。
  • 在生成帧上训练的Q网络(Qθ′)与真实Q网络(Qθ)的Q值预测结果几乎无差异,表明真实与生成状态表示之间具有良好的对齐性。
  • 当使用自生成样本持续微调时,轨迹质量在10步以上的规划中保持稳定,模型保真度在长时程规划中得以维持。
  • 尽管GDM和RP性能稳健,使用学习模型的有限深度MCTS仍未能生成更优策略,表明树搜索过程或价值估计中存在根本性缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。