Skip to main content
QUICK REVIEW

[論文レビュー] TOAD-GAN: Coherent Style Level Generation from a Single Example

Maren Awiszus, Frederik Schubert|arXiv (Cornell University)|Aug 4, 2020
Artificial Intelligence in Games被引用数 6
ひとこと要約

TOAD-GAN は、1つの例から 2次元レベルマップを生成するワンショット生成的対抗ネットワークであり、SinGAN をインspire したが、トークンベースのビデオゲームレベル向けに適応されたものである。1つの例から任意サイズのスタイル的に整合性のある多様なレベルを生成可能で、潜在空間の編集によりユーザーがグローバルなレイアウトを制御可能であり、最先端のパターンモデリングを達成するとともに、新しいレベル作成の可能性を提供する。

ABSTRACT

In this work, we present TOAD-GAN (Token-based One-shot Arbitrary Dimension Generative Adversarial Network), a novel Procedural Content Generation (PCG) algorithm that generates token-based video game levels. TOAD-GAN follows the SinGAN architecture and can be trained using only one example. We demonstrate its application for Super Mario Bros. levels and are able to generate new levels of similar style in arbitrary sizes. We achieve state-of-the-art results in modeling the patterns of the training level and provide a comparison with different baselines under several metrics. Additionally, we present an extension of the method that allows the user to control the generation process of certain token structures to ensure a coherent global level layout. We provide this tool to the community to spur further research by publishing our source code.

研究の動機と目的

  • プロシージャルコンテンツ生成(PCG)における限られた訓練データの課題に対処すること。多くの手法が大規模データセットを必要とし、スタイルの一貫性を維持できないこと。
  • 既存の PCGML 手法が混合スタイルのレベルを生成するか、解釈不能で制御不能であることの制限を克服すること。
  • SinGAN アーキテクチャをトークンベースのゲームレベルに拡張し、ワンショット学習と多様で整合性のあるレベルの生成を可能にすること。
  • 2次元トークンマップにおける重要な構造的要素を保持する、新しいダウンサンプリング手法の導入。
  • 最小スケールでのユーザー定義グローバルレイアウトを条件として生成プロセスに組み込むことで、ハイレベルな作成制御を可能にすること。

提案手法

  • 自然なRGB画像ではなく、2次元トークンベースのゲームレベルを生成するために、SinGANアーキテクチャを適応し、マルチスケールのパッチベース特徴抽出を用いる。
  • ワンホットエンコードされたレベルマップにカスタムダウンサンプリングアルゴリズムを適用し、小さなが重要な構造的トークンの損失を避ける。
  • 潜在空間の条件付け機構を採用し、バイリニアアップサンプリングにより最小スケールでの編集が全スケールに伝搬されるようにし、グローバルレイアウトの作成を可能にする。
  • レベルスライスに畳み込み分類器を訓練し、非線形特徴表現を抽出し、UMAPを用いて生成済みと実際のレベルの分布を可視化して比較する。
  • 生成済みと元のレベル間のスタイル忠実度を定量的に評価するため、タイルパターンKLダイバージェンス指標を適用する。
  • 訓練の安定化のため、インスタンス正規化とリプルReLU活性化関数を用いたWGAN-GPベースの訓練目的を採用する。

実験結果

リサーチクエスチョン

  • RQ1GANベースのモデルは、1つの訓練例から、スタイルを保持したまま、多様で整合性のあるビデオゲームレベルを生成できるか?
  • RQ2自然画像データとは根本的に異なるトークンベースの2次元レベルマップに、ワンショット学習をどのように適応できるか?
  • RQ3スタイルの一貫性を損なわず、ユーザーがガイドしたグローバルなレベル構造の作成が可能か?
  • RQ4生成済みのレベルは、実際のレベルと比較して、パターン分布や構造的多様性においてどのように異なるか?
  • RQ5潜在空間の可視化により、レベルタイプ間の意味的構造や多様体的関係を明らかにできるか?

主な発見

  • TOAD-GAN は、1つの例から、任意サイズの視覚的に整合性のある Super Mario Bros. および Super Mario Kart のレベルを生成でき、訓練レベルのスタイルとトークン分布を保持している。
  • タイルパターンKLダイバージェンスで測定したところ、訓練レベルのパターンモデリングにおいて最先端の性能を達成しており、複数のベースラインを上回っている。
  • UMAPを用いた潜在空間の可視化により、レベルタイプ(例:オーバーウールド、地下、浮遊プラットフォーム)に対応する明確なクラスタが確認され、学習済み特徴に意味的な構造があることが裏付けられた。
  • ユーザーが制御可能なグローバルレイアウト作成が可能である:最小スケールのトークンマップを編集することで、一貫したスタイルを維持したまま無限のバリエーションを生成でき、Super Mario Kart トラックで実証された。
  • 生成器は訓練分布内だけでなく、レベル多様体の近接領域にもスライスを生成するよう学習しており、強固で多様な生成が可能であることが示された。
  • 5つの畳み込み層と9つのスケールレベルを用いることで、Super Mario Kart のようなより大規模で複雑なゲームへの一般化を示した。この際も、整合性とスタイル忠実度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。