[论文解读] Multi-Objective Deep Q-Learning with Subsumption Architecture
本文提出了一种使用独立深度Q网络(DQNs)分别处理各个目标的多目标深度强化学习框架,通过受Brooks的从属架构启发的信号抑制机制进行协调。该方法实现了模块化、可替换的行为模块,共同生成单一动作,在2D视觉环境中实现了与单体DQN相当的性能,同时支持解耦学习和动态目标优先级排序。
In this work we present a method for using Deep Q-Networks (DQNs) in multi-objective tasks. Deep Q-Networks provide remarkable performance in single objective tasks learning from high-level visual perception. However, in many scenarios (e.g in robotics), the agent needs to pursue multiple objectives simultaneously. We propose an architecture in which separate DQNs are used to control the agent's behaviour with respect to particular objectives. In this architecture we use signal suppression, known from the (Brooks) subsumption architecture, to combine outputs of several DQNs into a single action. Our architecture enables the decomposition of the agent's behaviour into controllable and replaceable sub-behaviours learned by distinct modules. To evaluate our solution we used a game-like simulator in which an agent - provided with high-level visual input - pursues multiple objectives in a 2D world. Our solution provides benefits of modularity, while its performance is comparable to the monolithic approach.
研究动机与目标
- 解决在复杂、视觉丰富的环境中同时训练智能体追求多个目标的挑战。
- 通过将多目标任务分解为独立、可学习的DQN模块,实现模块化行为设计。
- 在保持与单体DQN方法相当的高性能的同时,提升可维护性和可适应性。
- 整合从属架构中的信号抑制机制,以解决并发目标之间的冲突。
提出的方法
- 该架构采用多个独立的DQN,每个DQN分别训练以优化特定目标。
- 每个DQN处理高层视觉输入,并为其对应的目标输出动作向量。
- 应用信号抑制机制以优先处理高优先级DQN的输出,从而有效抑制低优先级动作。
- 最终动作基于基于优先级的合并机制选择,当高优先级动作激活时,会抑制低层级动作。
- 通过启用或禁用单个DQN模块,支持目标的动态重构。
- 该方法在具有连续视觉观测和多个同时目标的2D游戏模拟器中进行了评估。
实验结果
研究问题
- RQ1具有信号抑制的模块化DQN架构是否能在视觉强化学习设置中有效管理多个目标?
- RQ2所提出的多目标DQN在相同环境下的性能与单体DQN相比如何?
- RQ3在不破坏整体智能体性能的前提下,单个行为模块在多大程度上可以被替换或重新配置?
- RQ4从属架构中的信号抑制机制在协调多个DQN产生的冲突动作方面表现如何?
- RQ5模块化设计是否在不牺牲学习效率的前提下,提升了多目标策略的可解释性和可维护性?
主要发现
- 所提出的架构在多目标2D模拟器中实现了与单体DQN相当的性能。
- 模块化行为设计支持独立训练和替换单个目标,而无需重新训练整个系统。
- 信号抑制通过优先处理高层目标,有效解决了动作冲突,模拟了分层控制机制。
- 通过动态激活模块,系统对目标优先级变化表现出良好的鲁棒性。
- 将DQN分解为独立模块提升了所学行为的可解释性,同时保持了具有竞争力的学习效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。