[论文解读] Learning to Play General Video-Games via an Object Embedding Network
本文提出了一种物体嵌入网络(OEN),将视频游戏中的可变长度物体特征向量压缩为固定长度的统一表示,使深度强化学习(DRL)智能体能够直接从结构化的游戏状态物体中学习。在五个GVG-AI游戏中进行评估,基于OEN的智能体实现了与使用原始像素输入的最先进DRL智能体相当的性能,证明了基于物体的表示在通用视频游戏AI中的可行性。
Deep reinforcement learning (DRL) has proven to be an effective tool for creating general video-game AI. However most current DRL video-game agents learn end-to-end from the video-output of the game, which is superfluous for many applications and creates a number of additional problems. More importantly, directly working on pixel-based raw video data is substantially distinct from what a human player does.In this paper, we present a novel method which enables DRL agents to learn directly from object information. This is obtained via use of an object embedding network (OEN) that compresses a set of object feature vectors of different lengths into a single fixed-length unified feature vector representing the current game-state and fulfills the DRL simultaneously. We evaluate our OEN-based DRL agent by comparing to several state-of-the-art approaches on a selection of games from the GVG-AI Competition. Experimental results suggest that our object-based DRL agent yields performance comparable to that of those approaches used in our comparative study.
研究动机与目标
- 解决仅依赖视频游戏原始像素输入的端到端深度强化学习(DRL)智能体的局限性。
- 克服基于像素的表示固有的高计算成本、泛化能力差以及可解释性不足等问题。
- 使DRL智能体能够从语义上有意义的游戏内物体数据中学习,从而更好地反映类人游戏理解。
- 开发一种由具有不同属性的可变数量物体组成的动态游戏状态的统一、固定长度表示。
- 证明基于物体的DRL可在多种视频游戏中实现与基于像素的最先进智能体相当的性能。
提出的方法
- 通过游戏引擎访问或视频的语义分割,从游戏状态中提取物体级特征(例如位置、速度、类型)。
- 将每个物体表示为包含其类别和属性的固定长度特征向量,确保跨物体类型的统一性。
- 使用基于集合的神经网络架构(OEN)处理可变大小的物体向量集合,并生成单个固定长度的嵌入向量。
- 使用DRL算法(例如DQN或Rainbow)端到端训练OEN,其中智能体的策略基于OEN嵌入的游戏状态。
- 在OEN中应用注意力机制或排列等变层,以处理物体顺序不变性并捕捉关系上下文。
- 通过游戏得分提供的稀疏奖励,联合优化OEN和策略。
实验结果
研究问题
- RQ1在通用视频游戏玩法中,基于物体表示训练的DRL智能体是否能优于或匹配基于原始像素数据训练的智能体?
- RQ2可学习的物体嵌入网络(OEN)在将可变长度、异构的物体集合压缩为固定长度的游戏状态表示方面有多有效?
- RQ3与基于像素的DRL相比,基于物体的表示是否能减少训练时间并提高样本效率?
- RQ4OEN智能体的性能在不同游戏类型和游戏状态复杂度水平下如何变化?
- RQ5在不重新训练或修改架构的情况下,基于物体的DRL在跨游戏场景中具有多大程度的泛化能力?
主要发现
- 基于OEN的DRL智能体成功学会了在测试的五个GVG-AI竞赛游戏中进行游戏,展示了在多种游戏机制下的鲁棒性。
- 在所有五个游戏中,OEN智能体的性能与基于像素的DRL智能体以及手工设计特征基线相当。
- 在某些游戏中,手工设计特征基线优于OEN智能体,表明某些特定于游戏的特征仍然非常有效。
- 尽管仅训练了两百万步(相当于约八百万帧),OEN智能体仍实现了稳定的学习曲线,并在多次运行中表现出一致的性能。
- OEN模型有效将可变长度的物体输入压缩为固定长度的表示,从而实现了与标准DRL架构的兼容性。
- 该方法在处理具有动态物体数量和复杂交互的游戏方面表现出潜力,表明其可扩展至更丰富的游戏环境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。