[论文解读] Mask Atari for Deep Reinforcement Learning as POMDP Benchmarks
Mask Atari 引入了一种基于Atari 2600游戏的新DRL基准,通过可控、可移动的遮罩模拟视野限制,并在部分可观察马尔可夫决策过程(POMDP)中实现主动信息获取(AIG)。该基准通过建模类人感受野来隔离认知表现,实验表明,用于信息获取的辅助奖励可加速学习,但可能导致次优策略。
We present Mask Atari, a new benchmark to help solve partially observable Markov decision process (POMDP) problems with Deep Reinforcement Learning (DRL)-based approaches. To achieve a simulation environment for the POMDP problems, Mask Atari is constructed based on Atari 2600 games with controllable, moveable, and learnable masks as the observation area for the target agent, especially with the active information gathering (AIG) setting in POMDPs. Given that one does not yet exist, Mask Atari provides a challenging, efficient benchmark for evaluating the methods that focus on the above problem. Moreover, the mask operation is a trial for introducing the receptive field in the human vision system into a simulation environment for an agent, which means the evaluations are not biased from the sensing ability and purely focus on the cognitive performance of the methods when compared with the human baseline. We describe the challenges and features of our benchmark and evaluate several baselines with Mask Atari.
研究动机与目标
- 为解决在复杂环境中缺乏高效、视觉丰富的POMDP基准,且聚焦于主动信息获取(AIG)的问题。
- 通过引入可移动、可学习的遮罩作为智能体的观察窗口,在强化学习中模拟类人感受野。
- 提供一个能将认知表现与感知限制分离的基准,从而实现与人类基线的公平比较。
- 评估DRL模型与启发式AIG策略在部分可观察、高维视觉环境中的有效性。
- 支持对遮罩参数(大小、速度、数量)的消融研究,以理解其对学习性能的影响。
提出的方法
- 通过在Atari 2600游戏上添加可控遮罩来构建Mask Atari,遮罩定义了智能体的视野范围。
- 通过额外的动作空间实现遮罩的动态移动,使智能体能够主动探索环境。
- 设计了支持多遮罩的接口,可自定义遮罩的大小、速度和位置。
- 引入辅助奖励函数以鼓励信息获取行为:一种基于图像新颖性,另一种基于遮罩覆盖范围的扩展。
- 使用标准DRL算法(如A2C-CNN)训练智能体,并在多个游戏中评估性能。
- 对遮罩尺度、速度和数量进行消融研究,分析其对学习和最终得分的影响。
实验结果
研究问题
- RQ1遮罩大小如何影响视觉丰富的POMDP环境中学习性能和最终得分?
- RQ2遮罩移动速度对AIG任务难度和智能体性能有何影响?
- RQ3增加遮罩数量如何影响信息获取与动作空间复杂性之间的权衡?
- RQ4基于信息获取行为的辅助奖励是否能加速Mask Atari上DRL智能体的学习?
- RQ5AIG设置的内部结构在多大程度上能实现更快的学习,同时不损害最终策略质量?
主要发现
- 将遮罩大小从50像素增加到100像素,在大多数游戏中提升了性能,尤其在MsPacman中平均得分显著提高了20%。
- 遮罩移动速度较慢(10 px/帧)通常使游戏更具挑战性,但其影响程度低于遮罩大小的变化。
- 遮罩速度从10提升到50 px/帧对性能的影响较温和,表明速度的重要性低于视野范围的大小。
- 使用两个遮罩的结果呈现两极分化:一半游戏得分提高,另一半表现更差,表明视野扩展与动作空间复杂性之间存在权衡。
- 基于获取新信息的辅助奖励在Asterix、Breakout和MsPacman中加速了学习,但导致了次优的最终策略。
- 基于扩展视野范围的辅助奖励同样加速了学习,但也导致了次优性能,表明基于AIG的奖励可加快训练,但以最终策略质量为代价。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。