Skip to main content
QUICK REVIEW

[論文レビュー] Using Fractal Neural Networks to Play SimCity 1 and Conway's Game of Life at Variable Scales

Sam Earle|arXiv (Cornell University)|Jan 29, 2020
Cellular Automata and Applications参考文献 7被引用数 9
ひとこと要約

本論文は、マイクロポリス(オープンソースのSimCity 1クローン)を用いて、変動するマップサイズの都市シミュレーションにおいて都市人口を最適化するエージェントを訓練する強化学習環境「gym-city」を紹介する。また、再帰的かつ重み共有構造を持つフラクタルニューラルネットワークを提案し、スケールに依存しない方策学習を可能にした。標準的な畳み込みベースラインと比較して、SimCity 1およびコンウェイのゲーム・オブ・ライフにおいて優れた一般化性能を示した。

ABSTRACT

We introduce gym-city, a Reinforcement Learning environment that uses SimCity 1's game engine to simulate an urban environment, wherein agents might seek to optimize one or a combination of any number of city-wide metrics, on gameboards of various sizes. We focus on population, and analyze our agents' ability to generalize to larger map-sizes than those seen during training. The environment is interactive, allowing a human player to build alongside agents during training and inference, potentially influencing the course of their learning, or manually probing and evaluating their performance. To test our agents' ability to capture distance-agnostic relationships between elements of the gameboard, we design a minigame within the environment which is, by design, unsolvable at large enough scales given strictly local strategies. Given the game engine's extensive use of Cellular Automata, we also train our agents to "play" Conway's Game of Life -- again optimizing for population -- and examine their behaviour at multiple scales. To make our models compatible with variable-scale gameplay, we use Neural Networks with recursive weights and structure -- fractals to be truncated at different depths, dependent upon the size of the gameboard.

研究の動機と目的

  • 都市シミュレーションにおいて、変動するマップサイズの下で都市人口を最適化するエージェントを訓練できる強化学習環境の開発。
  • 再帰的かつ重み共有構造を持つフラクタルニューラルネットワークが、都市およびセルオートマトン環境の異なるスケールにわたって一般化可能な方策を学習できるかの調査。
  • 階層的で深さが可変なニューラルアーキテクチャが、空間的に複雑なシミュレーションにおけるグローバルで距離に依存しない関係を捉える能力についての評価。
  • トレーニングおよび推論中の人間のインタラクションが、エージェントの方策学習およびパフォーマンスに与える影響の調査。

提案手法

  • 著者らは、マイクロポリスに基づいた独自のRL環境「gym-city」を構築した。これはSimCity 1のゲームエンジンをエミュレートし、可変サイズのゲームボードをサポートする。
  • エージェントは各ステップで全ゲームボードを観測し、任意のタイルに対して行動を取るため、完全な状態可視性を備えたグローバル方策学習が可能である。
  • フラクタルニューラルネットワークは再帰的重み共有と階層的深さを備えて実装されており、マップサイズに応じて同じコアブロックを異なる深さで切り詰めることができる。
  • アーキテクチャには、厳密に畳み込み型(StrictlyConv)、完全に畳み込み型(FullyConv)、および階層内および階層間の重み共有を有するフラクタルブロックを含み、アブレーションと比較のためのものである。
  • 環境は人間によるインタラクション(人間イン・ザ・ループ)をサポートする。人間の行動はキューに格納され、トレーニング中にエージェントの行動として扱われるため、ハイブリッド学習が可能である。
  • モデルはSimCity 1およびコンウェイのゲーム・オブ・ライフの両方で、人口最大化を目的に訓練され、複数のマップサイズ(例:16×16、32×32、64×64)でパフォーマンスが評価された。

実験結果

リサーチクエスチョン

  • RQ1再帰的かつ重み共有構造を持つフラクタルニューラルネットワークは、都市シミュレーションおよびセルオートマトン環境において、変動するマップサイズにわたって方策を一般化できるか?
  • RQ2方策ネットワークの受容 field サイズが、非局所的でグローバルな戦略を要するタスクにおけるパフォーマンスに与える影響はいかほどか?
  • RQ3トレーニング中の人間の行動が、インタラクティブなシミュレーション環境におけるエージェントの学習方策に、どの程度影響を及ぼすか?
  • RQ4フラクタルネットワークの各列間での重み共有は、サブネットワークを個別に訓練するのと比較して、一般化性およびパフォーマンスを向上させるか?
  • RQ5最小限で高パラメータ効率のアーキテクチャ(例:1層を再帰的に繰り返す)は、空間的推論タスクにおいて、より大きな標準的な畳み込みネットワークを同等または上回るパフォーマンスを達成できるか?

主な発見

  • StrictlyConvはSimCity 1およびゲーム・オブ・ライフの両方で、FullyConvと同等またはそれを上回る性能を示した。これは、その再帰的かつパラメータ効率の良い構造が一般化性能を向上させることを示唆している。
  • 階層内および階層間の重み共有を有する8層のフラクタルカラムは、ゲーム・オブ・ライフでFullyConvを上回った。これは、より大きな受容 field がグローバルタスクにおいてパフォーマンスを向上させることを示している。
  • 1層または2層のフラクタルネットワークは最も成績が悪く、浅い受容 field では複雑な空間的ダイナミクスを捉えるのに不十分であることが示された。
  • 大きなボード上で初期人口が減少した場合、エージェントは戦略をスケーリングして適応した。これは、高密度の局所的活動が効果的なグローバル計画を阻害する可能性があることを示している。
  • エージェントの構造に近接して人間プレイヤーが建設を行うと、エージェントは即座に反応する傾向があり、エージェントが外部の干渉に適応的に反応できることを示している。
  • フラクタルブロックにおける重み共有の使用により、顕著なパラメータ削減が可能であり、同時に競争力のあるパフォーマンスを維持した。これは、学習済みの空間的パターンの効率的再利用を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。