Skip to main content
QUICK REVIEW

[論文レビュー] FlapAI Bird: Training an Agent to Play Flappy Bird Using Reinforcement Learning Techniques

Tai Vu, Leon King Tran|arXiv (Cornell University)|Mar 21, 2020
Reinforcement Learning in Robotics参考文献 5被引用数 8
ひとこと要約

本論文では、ε-グリーディ探索、状態離散化、およびバックワードQ値更新といった技術を用いて、変更されたQ-LearningおよびSARSA強化学習アルゴリズムを用いてFlappy BirdをプレイするAIエージェントの訓練を提案している。最高のエージェントは2069という最大ゲームスコアを達成し、ベースラインを著しく上回った。限られた訓練リソース下で、Q-Learningと離散化が、深層ニューラルネットワークによる関数近似よりも効果的であることが示された。

ABSTRACT

Reinforcement learning is one of the most popular approaches for automated game playing. This method allows an agent to estimate the expected utility of its state in order to make optimal actions in an unknown environment. We seek to apply reinforcement learning algorithms to the game Flappy Bird. We implement SARSA and Q-Learning with some modifications such as $ε$-greedy policy, discretization and backward updates. We find that SARSA and Q-Learning outperform the baseline, regularly achieving scores of 1400+, with the highest in-game score of 2069.

研究の動機と目的

  • 表形式Q-LearningおよびSARSAの有効性を、Flappy Birdをプレイするエージェントの訓練において調査すること。
  • 状態離散化、ε-グリーディ探索、およびバックワードQ値更新が学習性能に与える影響を評価すること。
  • 線形回帰、フィードフォワードニューラルネットワーク(FFNN)、畳み込みニューラルネットワーク(CNN)を含む関数近似手法を、限られた訓練イテレーション下での表形式手法と比較すること。
  • 計算リソースが制限された環境下で、深層学習ベースの関数近似器が単純な表形式手法を上回るかを検証すること。
  • 8,000回の訓練イテレーション内でのエージェントパフォーマンスを最大化する最適なハイパーパramータ設定を特定すること。

提案手法

  • エージェントは、状態表現を鳩とパイプの相対的位置および鳩の速度に基づいて、OpenAI GymのFlappy Bird環境を用いて訓練した。
  • ε-グリーディ探索を用いたSARSAおよびQ-Learningアルゴリズムを実装し、探索と活用のバランスを取るためにεを0.1または0.0に設定した。
  • 状態空間の複雑さを軽減し収束性を向上させるために、10×10および20×20のグリッドを用いた状態離散化を適用した。
  • 報酬の伝搬を終了状態から軌道に沿って逆方向に実行することで、真のQ値への収束を加速するバックワードQ値更新を用いた。
  • 関数近似には線形回帰、フィードフォワードニューラルネットワーク(FFNN)、畳み込みニューラルネットワーク(CNN)をテストし、画像フレームと速度特徴量を入力とした。
  • 報酬関数は、各パイプを通過するごとに+1、ゲームオーバーの場合は-1000、それ以外は0を割り当て、スパarsな報酬を調整して学習を導くように設計した。

実験結果

リサーチクエスチョン

  • RQ1状態離散化を施したQ-Learningは、ベースラインエージェントおよび関数近似手法に比べ、Flappy Birdで優れた性能を示すか?
  • RQ2バックワードQ値更新は、前向き更新と比較して収束速度と最終的パフォーマンスにどのように寄与するか?
  • RQ3線形モデル、FFNN、CNNといった関数近似器は、限られた訓練イテレーション下で表形式Q-Learningに比べてパフォーマンスをどの程度向上させるか?
  • RQ4ε-グリーディ探索は、この環境下でのQ-LearningおよびSARSAエージェントのパフォーマンスにどのように影響を与えるか?
  • RQ5訓練が制限された状況下で、離散化を施した単純な表形式アプローチが、より複雑な深層学習モデルを上回るか?

主な発見

  • 10×10の離散化、バックワード更新、ε=0を用いたQ-Learningエージェントが、最高の最大スコア2069を記録した。
  • SARSAエージェントはベースラインを上回り、最大スコア832を記録したが、Q-Learningエージェントに劣った。
  • 離散化およびバックワード更新を施したすべてのQ-LearningおよびSARSAエージェントは、平均スコア0.13にとどまるベースラインを著しく上回った。
  • 関数近似手法(線形回帰、FFNN、CNN)は、平均スコア0.21~0.33の範囲でベースラインと同等またはわずかに上回ったが、限られたイテレーション下では学習が不十分であった。
  • CNNエージェントは、画像入力とより複雑なアーキテクチャを採用したが、訓練回数(8,000イテレーション)が不足しており、適切な特徴工学がなされていなかったため、単純なモデルを上回れなかった。
  • バックワードQ値更新により、終了状態の報酬が軌道に沿って逆方向に伝搬され、初期状態の学習が促進され、学習効率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。