[論文レビュー] An electronic-game framework for evaluating coevolutionary algorithms
本論文では、強化学習における共進化アルゴリズムの評価を目的として、『メガマンII』をベースにした電子ゲームフレームワーク、EvoManを紹介する。このフレームワークにより、遺伝的アルゴリズム(GA)およびNEAT(拡張トポロジーの神経進化)を用いたニューロエボリューションを実装し、適応的で変化する敵と同時に進化するエージェントの訓練が可能となり、競争的プレイ環境において、より高い適応性と兵器レース的ダイナミクスが実証された。
One of the common artificial intelligence applications in electronic games consists of making an artificial agent learn how to execute some determined task successfully in a game environment. One way to perform this task is through machine learning algorithms capable of learning the sequence of actions required to win in a given game environment. There are several supervised learning techniques able to learn the correct answer for a problem through examples. However, when learning how to play electronic games, the correct answer might only be known by the end of the game, after all the actions were already taken. Thus, not being possible to measure the accuracy of each individual action to be taken at each time step. A way for dealing with this problem is through Neuroevolution, a method which trains Artificial Neural Networks using evolutionary algorithms. In this article, we introduce a framework for testing optimization algorithms with artificial agent controllers in electronic games, called EvoMan, which is inspired in the action-platformer game Mega Man II. The environment can be configured to run in different experiment modes, as single evolution, coevolution and others. To demonstrate some challenges regarding the proposed platform, as initial experiments we applied Neuroevolution using Genetic Algorithms and the NEAT algorithm, in the context of competitively coevolving two distinct agents in this game.
研究の動機と目的
- 報酬がゲーム終了まで遅延して到着する環境では従来の教師あり学習が不適切であるという課題に対処すること。
- 自律的エージェント学習の評価に適した柔軟でカスタマイズ可能なテストベッドを提供すること、特に共進化的およびニューロエボリューション的アプローチに焦点を当てること。
- 現実世界の不確実性を反映した現実的で動的なゲーム環境をシミュレートし、人間の学習様式に類似した適応的AI行動を可能にすること。
- プレイヤーと敵エージェントが同時に進化する共進化的学習の可能性を検討すること。
- 制御可能で繰り返し可能な環境で学習アルゴリズムをテストすることにより、適応的で挑戦的で魅力的なビデオゲームAIボスの開発を支援すること。
提案手法
- 『メガマンII』をインspiredにしたカスタマイズ可能なゲーム環境を設計し、単一進化および共進化を含むさまざまなゲームモードを設定可能にする。
- 人工ニューラルネットワーク(ANN)をエージェントコントローラーとして使用し、遺伝的アルゴリズム(GA)およびNEAT(拡張トポロジーの神経進化)を用いて訓練するニューロエボリューションフレームワークを実装する。
- プレイヤーのエネルギー、敵の体力、生存時間といったゲーム内メトリクスに基づいたゲーム固有のフィットネス関数を定義し、進化的最適化を導く。
- メインプレイヤーエージェントと進化する敵エージェントを対戦させることで共進化を実現し、両者が互いに上回るために同時に進化するようにする。
- 各エージェントのゲノムがANNの重みを符号化する集団ベースの進化的手法を採用し、世代を経て選択、交差、突然変異を適用する。
- 比較のためのヒューリスティックベースラインを導入し、まず固定された事前プログラム済みの敵行動に対して学習を行い、その後共進化的訓練に移行する。
実験結果
リサーチクエスチョン
- RQ1報酬が遅延するゲーム環境において、共進化的アルゴリズムは、進化する敵行動に適応するエージェントを効果的に学習させることができるか?
- RQ2固定敵行動に対する学習と共進化的敵に対する学習において、ニューロエボリューション(GAおよびNEAT)の性能はどのように異なるか?
- RQ3共進化的設定はどの程度兵器レースを生じさせ、両エージェントが互いに応じて継続的に向上するか?
- RQ4どの敵が学習しにくく、ヒューリスティックおよび共進化的設定の両方で、異なる敵タイプごとの学習曲線はどのように変化するか?
- RQ5共進化的アプローチは、単一エージェント学習と比較して、より強固で汎用性の高い戦略を生み出すのか?
主な発見
- ヒューリスティック実験では、エージェントは全敵を倒すことに成功し、AirManが最も簡単(早期に倒した)で、FlashMan、WoodMan、HeatManが最も倒しにくかった。
- 共進化的実験では、メインプレイヤーはFlashManに対して平均エネルギー0、AirManに対して74、WoodManに対して4を記録し、一部の敵に対しては強く、他の敵に対しては失敗していることが示された。
- MetalManに対しては、共進化において高いパフォーマンス(平均エネルギー94)を維持しており、安定した適応が確認されたが、FlashManに対してはパフォーマンスが低く(平均エネルギー0)継続的な困難が見られた。
- AirManおよびQuickManに対しては、勝ち負けが交互に繰り返されるなど、兵器レースの兆候が最も顕著に現れ、時間経過に伴う動的な適応が観察された。
- NEATアルゴリズムは、特にMetalManやCrashManのような敵に対して、高い突然変異率と染色体表現の感受性のため、完全な解決策を長期間にわたり維持できなかった。
- 100世代にわたるプレイヤーと敵のエネルギーの進化(図4)から、一部の敵(例:AirMan)に対しては初期に成功しても、持続的なパフォーマンスを保証しないことが明らかになった。これは、共進化的設定においてはより長い訓練期間が必要であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。