Skip to main content
QUICK REVIEW

[论文解读] FlapAI Bird: Training an Agent to Play Flappy Bird Using Reinforcement Learning Techniques

Tai Vu, Leon King Tran|arXiv (Cornell University)|Mar 21, 2020
Reinforcement Learning in Robotics参考文献 5被引用 8
一句话总结

本文提出通过改进的Q-Learning和SARSA强化学习算法训练AI智能体玩《Flappy Bird》,采用ε-greedy探索、状态离散化和反向Q值更新等技术。表现最佳的智能体在游戏内最高得分达到2069分,显著优于基线模型,其中Q-Learning与状态离散化在训练资源有限的条件下比深度神经网络函数逼近器更有效。

ABSTRACT

Reinforcement learning is one of the most popular approaches for automated game playing. This method allows an agent to estimate the expected utility of its state in order to make optimal actions in an unknown environment. We seek to apply reinforcement learning algorithms to the game Flappy Bird. We implement SARSA and Q-Learning with some modifications such as $ε$-greedy policy, discretization and backward updates. We find that SARSA and Q-Learning outperform the baseline, regularly achieving scores of 1400+, with the highest in-game score of 2069.

研究动机与目标

  • 研究表格Q-Learning与SARSA在训练智能体玩《Flappy Bird》中的有效性。
  • 评估状态离散化、ε-greedy探索和反向Q值更新对学习性能的影响。
  • 在训练迭代次数有限的条件下,对比函数逼近方法(包括线性回归、前馈神经网络和卷积神经网络)与表格方法的性能。
  • 确定在计算资源受限的情况下,基于深度学习的函数逼近器是否优于更简单的表格方法。
  • 识别在8,000次训练迭代内使智能体性能最大化的最优超参数配置。

提出的方法

  • 智能体在OpenAI Gym的《Flappy Bird》环境中训练,状态表示基于小鸟与管道的相对位置及小鸟速度。
  • 实现SARSA与Q-Learning算法,采用ε-greedy探索策略,ε值设为0.1或0.0以平衡探索与利用。
  • 通过10×10和20×20网格应用状态离散化,以降低状态空间复杂度并提升收敛性。
  • 使用反向Q值更新技术,将终端状态的奖励沿轨迹反向传播,加速收敛至真实Q值。
  • 函数逼近通过线性回归、前馈神经网络(FFNN)和卷积神经网络(CNN)实现,输入包括图像帧和速度特征。
  • 奖励函数设定为:通过每个管道得+1分,游戏结束得-1000分,其余情况得0分,以塑造稀疏奖励以引导学习。

实验结果

研究问题

  • RQ1Q-Learning结合状态离散化是否在《Flappy Bird》中优于基线智能体和函数逼近方法?
  • RQ2与前向更新相比,反向Q值更新在多大程度上提升了收敛速度和最终性能?
  • RQ3在训练迭代次数有限的条件下,线性模型、FFNN和CNN等函数逼近器在多大程度上提升了性能,相较于表格Q-Learning?
  • RQ4ε-greedy探索在本环境中对Q-Learning与SARSA智能体的性能有何影响?
  • RQ5当训练受限时,是否更简单的表格方法结合离散化能够超越更复杂的深度学习模型?

主要发现

  • 采用10×10离散化、反向更新和ε=0的Q-Learning智能体达到最高最大得分2069分。
  • SARSA智能体表现优于基线,最高得分为832分,但仍逊于Q-Learning智能体。
  • 所有采用离散化和反向更新的Q-Learning与SARSA智能体均显著优于基线(平均仅0.13分)。
  • 函数逼近方法(线性回归、FFNN和CNN)的性能处于或略高于基线,平均得分在0.21至0.33之间,表明在有限迭代下学习效果较差。
  • 尽管CNN智能体使用图像输入和更复杂的架构,但因训练不足(仅8,000次迭代)且特征工程不足,未能超越简单模型。
  • 反向Q值更新通过使早期状态能从终端状态奖励中学习,加速了收敛,提升了学习效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。