[论文解读] Classifying Options for Deep Reinforcement Learning
本文提出了一种分层深度强化学习方法,通过在深度Q网络(DQNs)中引入选项框架,利用多个“选项头”和一个监督网络来选择子任务。结果表明,在存在负面迁移的任务中,显式结构化的选项头可显著降低样本复杂度,同时在正向迁移设置下仍能保持性能,即使模型容量有限。
In this paper we combine one method for hierarchical reinforcement learning - the options framework - with deep Q-networks (DQNs) through the use of different "option heads" on the policy network, and a supervisory network for choosing between the different options. We utilise our setup to investigate the effects of architectural constraints in subtasks with positive and negative transfer, across a range of network capacities. We empirically show that our augmented DQN has lower sample complexity when simultaneously learning subtasks with negative transfer, without degrading performance when learning subtasks with positive transfer.
研究动机与目标
- 探究在深度强化学习中显式构建选项是否能提升样本效率和泛化能力。
- 探讨通过选项框架引入的分层强化学习架构约束如何影响深度Q网络的学习效果。
- 评估以子任务分解形式存在的领域知识对训练效率和性能的影响。
- 在不同模型容量下,比较带有选项头的DQN与标准DQN及半DQN基线模型的性能表现。
- 评估选项框架提供的结构先验是否能减少多子任务学习中的干扰,特别是在子任务存在冲突时。
提出的方法
- 该方法在标准DQN基础上,于共享卷积层之上添加多个选项头,每个选项头负责一个独立的子任务。
- 引入一个监督网络,用于在推理过程中预测每个状态下应选择的选项(子任务)。
- 每个选项头为其对应的子任务学习独立的Q函数,共享特征由卷积主干网络提取。
- 使用组合损失函数进行训练,包括每个头的Q学习损失和监督网络的交叉熵损失。
- 在自定义环境中评估该方法,其中智能体需捕捉或躲避彩色球体,代表具有正向或负向迁移的子任务。
- 系统性地改变模型容量以研究其对性能的影响,并在标准DQN、半DQN和所提出的带选项头DQN之间进行比较。
实验结果
研究问题
- RQ1通过选项头显式构建子任务是否能提升深度强化学习中的样本效率?
- RQ2当子任务之间存在负面迁移时,标准DQN与带选项头的DQN在学习效果上有何差异?
- RQ3模型容量在多大程度上影响标准DQN与所提出的结构化选项DQN之间的性能差距?
- RQ4来自选项框架的架构约束是否能在不降低兼容子任务性能的前提下,减少冲突子任务之间的干扰?
- RQ5监督网络是否能有效学习选项分配任务?其学习能力是否能实现更快的策略收敛?
主要发现
- 在学习具有负面迁移的子任务时,带选项头的DQN相比标准DQN显著降低了样本复杂度,尤其在低模型容量下表现更优。
- 在正向迁移设置下,带选项头的DQN性能与标准DQN相当,表明即使在架构改变的情况下也未出现性能下降。
- 随着模型容量的增加,带选项头的DQN与标准DQN之间的性能差距逐渐缩小,表明容量最终可弥补架构限制。
- 半DQN基线(头容量减半)收敛到与完整DQN带选项头相同的策略性能,但需要更多训练步数,证实结构先验可提升学习效率。
- 共享卷积层学习到通用特征(如球体运动、挡板位置),而每个选项头则专注于捕捉或躲避球体,表明特征与策略实现了有效解耦。
- 监督网络能快速学会将状态分类到合适的选项中,表明选项分配任务本身较简单且易于学习,即使没有真实标签(oracle)也表现良好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。