Skip to main content
QUICK REVIEW

[论文解读] Disentangled Planning and Control in Vision Based Robotics via Reward Machines

Alberto Rivas, Jacob Varley|arXiv (Cornell University)|Dec 28, 2020
Computability, Logic, AI Algorithms参考文献 34被引用 4
一句话总结

该论文提出了一种基于奖励机器的深度Q学习方法(DQRM),以提升视觉感知机器人操作任务中的样本效率和策略质量。通过利用抽象状态表示解耦规划与控制,并结合奖励机器实现密集奖励塑造,DQRM实现了卓越性能——在200次训练批次内即学习到高质量策略,优于标准DQN和混合基线方法。

ABSTRACT

In this work we augment a Deep Q-Learning agent with a Reward Machine (DQRM) to increase speed of learning vision-based policies for robot tasks, and overcome some of the limitations of DQN that prevent it from converging to good-quality policies. A reward machine (RM) is a finite state machine that decomposes a task into a discrete planning graph and equips the agent with a reward function to guide it toward task completion. The reward machine can be used for both reward shaping, and informing the policy what abstract state it is currently at. An abstract state is a high level simplification of the current state, defined in terms of task relevant features. These two supervisory signals of reward shaping and knowledge of current abstract state coming from the reward machine complement each other and can both be used to improve policy performance as demonstrated on several vision based robotic pick and place tasks. Particularly for vision based robotics applications, it is often easier to build a reward machine than to try and get a policy to learn the task without this structure.

研究动机与目标

  • 解决标准深度Q网络(DQN)在视觉感知机器人任务中样本效率低下和收敛性差的问题。
  • 探究将潜在状态特征学习与策略学习解耦是否能提升训练稳定性和性能。
  • 评估在深度强化学习中结合抽象状态监督与密集奖励塑造的有效性。
  • 证明可从专家示范中构建奖励机器,以引导策略学习。
  • 表明即使观测中存在冗余信息,抽象状态表示对DQN学习有效策略也至关重要。

提出的方法

  • 引入奖励机器(RM),一种有限状态机,通过抽象状态和基于转移的密集奖励来建模任务结构。
  • 使用手工设计的特征检测器提取任务相关的状态特征(如积木位置、夹爪状态)以定义抽象状态。
  • 从专家示范中构建RM,确保Q值保持在零附近,以实现稳定的深度学习。
  • 在DQN中引入独热编码的抽象状态输入,并结合由RM导出的密集奖励函数,以引导探索。
  • 采用基于ResNet的编码器将原始观测分类为抽象状态,实现端到端的抽象状态监督训练。
  • 将示范数据与离策略回放缓冲区结合,使DQRM能够利用专家数据实现更快收敛。

实验结果

研究问题

  • RQ1抽象状态表示是否能显著提升DQN在视觉感知机器人任务中的样本效率和最终策略质量?
  • RQ2将抽象状态监督与密集奖励塑造结合,是否能带来优于单独使用任一信号的性能?
  • RQ3能否从少量专家示范中有效构建奖励机器以引导DQN训练?
  • RQ4抽象状态带来的性能增益是否依赖于任务的时域长度(如短时域与长时域任务)?
  • RQ5DQRM框架在多大程度上减少了达到高策略成功率所需的训练步数?

主要发现

  • 即使在观测中包含抽象状态信息,标准DQN在简单视觉感知抓取-放置任务中仍无法学习到高质量策略。
  • DQRM仅使用100次示范即达到DQN使用500次示范时的性能水平,展现出强大的数据效率。
  • DQRM在200次训练批次内即达到可接受的成功率,而仅使用奖励塑造的DQN需1,500次批次才能收敛。
  • DQRM中抽象状态与密集奖励塑造的结合,相比单独使用任一信号,能生成更稳定、更高质量的策略。
  • 在长时域任务(如包含六个步骤的装配任务)中,抽象状态监督尤为有效,而DQN(AS)单独使用时无法提升性能。
  • 基于ResNet的分类器成功将原始观测映射到抽象状态,证实了在实践中抽象状态识别是可行且简便的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。