Skip to main content
QUICK REVIEW

[论文解读] Learn What Not to Learn: Action Elimination with Deep Reinforcement Learning

Tom Zahavy, Matan Haroush|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 54被引用 77
一句话总结

本文提出 AE-DQN,一种深度强化学习架构,联合学习 DQN 和 Action Elimination Network (AEN),通过消除信号剪枝次优动作,在像 Zork 这样的文本游戏等大动作空间中加速学习。

ABSTRACT

Learning how to act when there are many available actions in each state is a challenging task for Reinforcement Learning (RL) agents, especially when many of the actions are redundant or irrelevant. In such cases, it is sometimes easier to learn which actions not to take. In this work, we propose the Action-Elimination Deep Q-Network (AE-DQN) architecture that combines a Deep RL algorithm with an Action Elimination Network (AEN) that eliminates sub-optimal actions. The AEN is trained to predict invalid actions, supervised by an external elimination signal provided by the environment. Simulations demonstrate a considerable speedup and added robustness over vanilla DQN in text-based games with over a thousand discrete actions.

研究动机与目标

  • 在动作空间极其庞大、许多动作冗余或无关的环境中,激励学习策略。
  • 提出一个利用消除信号来剪枝可接受动作的框架,减少样本复杂性并提升深度RL的鲁棒性。
  • 开发并评估一个双网络架构(DQN + AEN),在 NLP 基础任务中共同学习动作价值和消除规则。

提出的方法

  • 提出 Action-Elimination Deep Q-Network (AE-DQN),同时训练 DQN 和 Action Elimination Network (AEN)。
  • 使用 AEN 通过环境提供的 elimination 信号预测无效动作;为 DQN 推导一个可接受的动作集合。
  • 用面向 NLP 的 CNN 表示状态和动作;将 AEN 的最后一层激活作为线性情境赌博机的特征来决定消除。
  • 构建一个批量更新框架,在该框架中从 AEN 激活定期更新情境赌博机模型,以将消除与 MDP 学习解耦。
  • 基于来自线性情境赌博机的集中度界限来定义动作消除标准,以确保高概率保持有效动作。
  • 提供一个算法 (AE-DQN),将标准 Q-learning 更新与基于消除的动作剪枝交替进行,使用对可接受动作的 epsilon-greedy 探索。
  • 在文本基础的 Zork 领域进行评估,动作数以千计,包含子域 Egg Quest 和 Troll Quest,并与 vanilla DQN 和基线方法进行比较。

实验结果

研究问题

  • RQ1通过学习的消除信号进行动作消除,是否能加速在大动作空间中的学习,相较于标准 DQN?
  • RQ2一个解耦的情境赌博机模型是否能够以高概率可靠地识别无效动作,而不消除有效动作?
  • RQ3在具有组合大行动空间的文本游戏中,AE-DQN 的表现如何,其对超参数的鲁棒性如何?
  • RQ4在大规模 NLP-动作环境中,动作消除对样本效率和最终性能有何影响?

主要发现

  • AE-DQN 在大动作空间设置(例如 Zork)中优于 vanilla DQN,学习更快、累积奖励更高。
  • 动作消除对超参数设置具有鲁棒性,特别是在动作集非常大时(例如 Egg Troll 子域)。
  • 使用 AEN 激活来形成一个情境赌博机,可以可靠地消除次优动作,减少对无效动作的探索。
  • 模块化的消除方法在达到足够的消除准确性时,降低样本复杂性并收敛于高效策略。
  • 在 Zork 及其子域中,AE-DQN 与以往工作相比达到最先进或具有竞争力的结果,尽管使用的动作模板要大得多。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。