Skip to main content
QUICK REVIEW

[論文レビュー] Megaverse: Simulating Embodied Agents at One Million Experiences per Second

Aleksei Petrenko, Erik Wijmans|arXiv (Cornell University)|Jul 17, 2021
Virtual Reality Applications and Impacts被引用数 4
ひとこと要約

Megaverseは、エムベデッドAIおよび強化学習のための高スループット3次元シミュレーションプラットフォームであり、バッチ処理されたレンダリングと物理シミュレーションを活用することで、1台の8GPUノードで1秒間に100万件を超える経験を達成している。これにより、没入型の手続き的生成環境において、単一および複数エージェントの高速かつスケーラブルな学習が可能となり、ナビゲーション、記憶、物体操作といった高度なスキルを課す新しいベンチマーク(Megaverse-8)を提供している。

ABSTRACT

We present Megaverse, a new 3D simulation platform for reinforcement learning and embodied AI research. The efficient design of our engine enables physics-based simulation with high-dimensional egocentric observations at more than 1,000,000 actions per second on a single 8-GPU node. Megaverse is up to 70x faster than DeepMind Lab in fully-shaded 3D scenes with interactive objects. We achieve this high simulation performance by leveraging batched simulation, thereby taking full advantage of the massive parallelism of modern GPUs. We use Megaverse to build a new benchmark that consists of several single-agent and multi-agent tasks covering a variety of cognitive challenges. We evaluate model-free RL on this benchmark to provide baselines and facilitate future research. The source code is available at https://www.megaverse.info

研究の動機と目的

  • ゲームエンジンベースのRLシミュレータがGPU並列処理を十分に活用できず、フレームスキップを要するという非効率性を是正すること。
  • 3次元環境におけるエムベデッドエージェントの高スループット・低レイテンシーシミュレーションを可能にすることで、ディープ強化学習研究を加速すること。
  • 計算コストを低減しながらも豊富でインタラクティブなシーンを維持することで、大規模かつ高精細なシミュレーションへのアクセスを民主化すること。
  • 記憶、ナビゲーション、物理ベースの操作を要する複雑で一般化可能なタスクを支援し、エムベデッド知能の発展を促進すること。
  • パフォーマンス劣化を最小限に抑えつつ、協調的および競合的設定を含むスケーラブルな複数エージェント学習を可能にすること。

提案手法

  • プラットフォームはバッチ処理されたレンダリングと物理シミュレーションを用いてGPU並列処理を最大限に活用し、フレームスキップを排除することで、高頻度の経験収集を実現している。
  • 従来のエンジンよりも低い周波数で物理シミュレーションを実行することで、計算オーバーヘッドを低減しながらも、学習に十分な現実性を維持している。
  • エンジンは、パフォーマンス劣化を伴わずに複数エージェントを同じ環境にネイティブでサポートしており、効率的な複数エージェント学習を可能としている。
  • エージェントの一般化性と耐性をテストするため、手続き的に多様な環境を生成している。
  • 8つのタスクを含む新ベンチマーク「Megaverse-8」が導入され、ナビゲーション、記憶、探索、操作をカバーしており、すべてが高次元のエゴセントリック観測を持つ。
  • 協調性を促進するために、チームスピリットなどの報酬形状技術が使用されており、カリキュラムベースの段階的導入が行われている。

実験結果

リサーチクエスチョン

  • RQ1目的に特化したシミュレーションエンジンは、1台の8GPUノードで複雑な3次元インタラクティブ環境をサポートしながら、1秒間に100万件を超えるRL経験を達成できるか?
  • RQ2従来のゲームエンジンベースのRL環境と比較して、バッチ処理シミュレーションはスループットとリソース利用効率をどのように向上させるか?
  • RQ3高速シミュレーションは、パフォーマンス劣化を伴わず、協調的および競合的設定におけるスケーラブルな複数エージェント学習をどの程度可能にするか?
  • RQ4高速シミュレーションは、高次元3次元環境における勾配なし最適化などの高度な最適化手法の評価を加速できるか?
  • RQ5チームスピリットのような報酬形状戦略は、複雑な複数エージェントタスクにおけるエージェント間の協調をどの程度効果的に可能にするか?

主な発見

  • Megaverseは、1台の8GPUノードで1秒間に110万件の観測を達成しており、完全にシャドウイングされた3次元シーンにインタラクティブオブジェクトを含む環境で、DeepMind Lab比70倍の高速化を実現している。
  • 標準的な研究用ハードウェア上でも、アタリの20倍、DeepMind Labの70倍の速度でシミュレーションが可能であり、フレームスキップを一切行わない。
  • 複数エージェント学習は効率的にスケーリング可能であり、数十体のエージェントが同じ環境で同時にシミュレート可能で、パフォーマンス劣化なしに運用可能である。
  • HexExploreやCollectのタスクでは、複数エージェントが性能向上に寄与するが、チームスピリットの報酬形状は、信用割り当ての難易度上昇により性能を低下させる。
  • TowerBuildingタスクでは、チームスピリットが協調性を確保するために不可欠であり、導入しないとエージェント同士が競合し、エージェント数が増えると性能が劣化する。
  • Megaverse-8ベンチマークには、記憶、物体操作、低レベル行動の組み合わせを要する8つの手続き的生成タスクが含まれており、現在のRLアルゴリズムにとって非常に困難な挑戦となっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。