Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Doom using Unsupervised Auxiliary Tasks

Georgios Papoudakis, Kyriakos C. Chatzidimitriou|arXiv (Cornell University)|Jul 5, 2018
Reinforcement Learning in Robotics参考文献 4被引用 5
一句话总结

本文提出了一种基于无监督辅助任务的深度强化学习智能体,用于复杂的第一人称射击游戏Doom,采用异步优势演员-critic(A3C)框架,引入了价值函数重放、奖励预测和像素控制三种辅助任务。联合训练的智能体在未知环境中表现优于专用动作智能体,显著提升了物品收集效率,并在关键指标上达到统计显著性,证明了通过辅助学习实现更强泛化能力的有效性。

ABSTRACT

Recent developments in deep reinforcement learning have enabled the creation of agents for solving a large variety of games given a visual input. These methods have been proven successful for 2D games, like the Atari games, or for simple tasks, like navigating in mazes. It is still an open question, how to address more complex environments, in which the reward is sparse and the state space is huge. In this paper we propose a divide and conquer deep reinforcement learning solution and we test our agent in the first person shooter (FPS) game of Doom. Our work is based on previous works in deep reinforcement learning and in Doom agents. We also present how our agent is able to perform better in unknown environments compared to a state of the art reinforcement learning algorithm.

研究动机与目标

  • 为解决在Doom等复杂稀疏奖励环境中训练有效智能体的挑战,传统深度强化学习因状态空间庞大和奖励延迟而表现不佳。
  • 通过引入无监督辅助任务,在不需额外监督的情况下提升深度强化学习的样本效率与泛化能力。
  • 评估将动作与导航任务分离训练的智能体(即分而治之方法)是否能有效整合为单一智能体,并在未见环境中表现更优。
  • 证明辅助任务可增强高维视觉环境(如Doom)中的特征学习与策略性能。

提出的方法

  • 智能体采用异步优势演员-critic(A3C)框架,共享卷积层用于策略网络与价值网络,随后分别输出动作与导航的头网络。
  • 引入三项无监督辅助任务:价值函数重放(在经验回放缓冲区上重新训练以稳定价值函数学习)、奖励预测(从状态转移中预测未来奖励)以及像素控制(从潜在表示中重建输入帧)。
  • 辅助任务与主强化学习目标联合训练,采用多任务损失函数,总损失由策略损失、价值损失及辅助任务损失共同构成。
  • 策略与价值网络通过在并行环境中收集的经验,使用随机梯度下降进行训练,全局网络异步更新。
  • 导航智能体在密集奖励环境中预训练,其中包含大量可收集物品;动作智能体则在敌人数众多的环境中训练,以最大化击杀数。
  • 通过合并两个智能体的策略头,形成联合智能体,实现同时追求击杀敌人与收集物品的目标。

实验结果

研究问题

  • RQ1无监督辅助任务是否能提升复杂3D环境(如Doom)中深度强化学习的样本效率与泛化能力?
  • RQ2将动作与导航任务分别训练的分而治之方法,是否能在整合为单一智能体后实现更优性能?
  • RQ3在稀疏奖励的未知环境中,联合智能体与专用动作智能体的性能相比如何?
  • RQ4在不引入额外奖励信号的前提下,辅助任务在多大程度上增强了特征学习与策略性能?

主要发现

  • 联合智能体在Known 3地图上实现了116.8件物品收集量,远超动作智能体的7.57次击杀与6.53次死亡,表明其在导航与物品收集方面表现更优。
  • 在未知环境(Unknown 1)中,联合智能体在物品收集(20.19 vs. 5.46)与击杀数(5.89 vs. 4.99)上均优于动作智能体,且多数指标具有统计显著性(p < 0.05)。
  • 在Known 3地图上,联合智能体收集116.8件物品,动作智能体为62.4件,p值为6.08×10⁻⁸,表明改进效果高度显著。
  • 动作智能体在已知地图上(如Known 3)的击杀与死亡表现更优(例如,14.7次击杀),这与其专门化训练一致,但在物品收集方面表现较差。
  • 统计t检验确认,所有环境中物品收集与死亡数的改进均具有显著性(p < 0.05),其中Known 2地图上物品收集的p值低至1.56×10⁻¹¹。
  • 引入辅助任务后,策略更加稳定且具备更强泛化能力,使智能体即使在稀疏奖励条件下,也能有效适应未见过的地图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。