QUICK REVIEW
[論文レビュー] Evolution of Neural Networks to Play the Game of Dots-and-Boxes
Lex Weaver, Terry Bossomaier|ArXiv.org|Sep 28, 1998
Artificial Intelligence in Games参考文献 8被引用数 7
ひとこと要約
本稿では、最適解が知られていないゲームであるDots-and-Boxesをプレイするための人工ニューラルネットワークを進化させることを提案する。共同進化型トレーニングを用いることで、ネットワークは最終結果を予測するのではなく、実戦を通じて強い手を推薦するよう学習し、ヒューリスティックなオラクルを用いたバックプロパゲーションで訓練されたネットワークよりも優れた一般化性能を達成した。
ABSTRACT
Dots-and-Boxes is a child's game which remains analytically unsolved. We implement and evolve artificial neural networks to play this game, evaluating them against simple heuristic players. Our networks do not evaluate or predict the final outcome of the game, but rather recommend moves at each stage. Superior generalisation of play by co-evolved populations is found, and a comparison made with networks trained by back-propagation using simple heuristics as an oracle.
研究の動機と目的
- 明示的なゲーム結果評価に依存せずに、Dots-and-Boxesをプレイするためのニューラルネットワークを開発すること。
- 共同進化型ニューラルネットワークが、ヒューリスティックなガイダンスでバックプロパゲーションで訓練されたネットワークよりも、一般化性能が優れているかどうかを調査すること。
- 単純なヒューリスティックプレーヤーとの競争環境において、進化したネットワークのパフォーマンスを評価すること。
- 戦略的深さが高く、最適戦略が知られていないゲームにおいて、進化計算を用いてエージェントを訓練する可能性を検討すること。
提案手法
- プレイヤー同士が繰り返しDots-and-Boxesの対局を行う共同進化的アルゴリズムを用いてニューラルネットワークを訓練する。
- 各ネットワークは、最終的なゲーム結果を推定せずに、各ゲーム状態で手の提案を行う。
- トレーニングプロセスは、ラベル付き例を用いたバックプロパゲーションではなく、ゲームパフォーマンスに基づくフィットネスを用いる。
- パフォーマンスは、ヒューリスティックルールをオラクルとして用いたバックプロパゲーションで訓練されたネットワークと比較する。
- アーキテクチャは、隠れ層を明示的に記述しないフィードフォワードネットワークであるが、学習メカニズムは価値予測よりもポリシーの進化に重点を置いている。
- 進化選択は、競合するネットワーク間でのトーナメント形式の対戦における勝率に基づく。
実験結果
リサーチクエスチョン
- RQ1共同進化型ニューラルネットワークは、バックプロパゲーションで訓練されたネットワークを上回る性能を示せるか?
- RQ2最終結果の予測ではなく、手の推薦に特化して訓練されたニューラルネットワークは、このゲームにおいてより優れた一般化性能を示せるか?
- RQ3進化計算は、最適戦略が知られていないゲームのエージェントを効果的に訓練できるか?
- RQ4単純なヒューリスティックプレーヤーと比較して、進化したネットワークの勝率と適応性はどの程度か?
主な発見
- 共同進化型ニューラルネットワークは、ヒューリスティックオラクルを用いたバックプロパゲーションで訓練されたネットワークよりも優れた一般化性能を示した。
- 進化したネットワークは、最終ゲーム結果の明示的評価なしに、強力で戦略的なプレイを学習できた。
- 競争的対局においても性能向上が確認され、進化によってゲーム固有の戦術が効果的に学習されたことが示された。
- 進化トレーニングにおいて安定した収束が達成されたため、複雑な手の選択を学習する上で堅牢性があることが示された。
- 結果から、戦略的複雑性の高いゲームにおいて、ヒューリスティックラベルを用いた教師あり学習の代替手段として、進化学習が有効であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。