Skip to main content
QUICK REVIEW

[論文レビュー] Using Unity to Help Solve Intelligence

Tom Ward, Andrew Bolt|arXiv (Cornell University)|Nov 18, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 6
ひとこと要約

本論文では、Unity(汎用ゲームエンジン)を用いて、既存のプラットフォームに制限を受けることのない多様で複雑な強化学習環境を構築するフレームワークを提示する。標準化された通信プロトコルと再現可能なパッケージング手法を採用することで、研究者らが効率的で再利用可能かつスケーラブルなシミュレーション環境を構築可能にし、多様なAI研究課題をサポートする。この有効性は、複数の出版済み論文における応用事例によって裏付けられている。

ABSTRACT

In the pursuit of artificial general intelligence, our most significant measurement of progress is an agent's ability to achieve goals in a wide range of environments. Existing platforms for constructing such environments are typically constrained by the technologies they are founded on, and are therefore only able to provide a subset of scenarios necessary to evaluate progress. To overcome these shortcomings, we present our use of Unity, a widely recognized and comprehensive game engine, to create more diverse, complex, virtual simulations. We describe the concepts and components developed to simplify the authoring of these environments, intended for use predominantly in the field of reinforcement learning. We also introduce a practical approach to packaging and re-distributing environments in a way that attempts to improve the robustness and reproducibility of experiment results. To illustrate the versatility of our use of Unity compared to other solutions, we highlight environments already created using our approach from published papers. We hope that others can draw inspiration from how we adapted Unity to our needs, and anticipate increasingly varied and complex environments to emerge from our approach as familiarity grows.

研究の動機と目的

  • 既存の強化学習プラットフォームが、その基盤となるゲームエンジンの制限や環境設計の多様性不足に起因する制限を克服すること。
  • 一般知能の評価に適した、視覚的に豊かで計算効率の良い複雑な仮想環境を構築すること。
  • すべての依存関係を含む環境のパッケージング・配布方法を標準化することで、強化学習研究における再現性を向上させること。
  • Unityを、多様で1人称視点、3次元、および手続き的生成可能な環境を備えた強化学習の基盤としての柔軟性とスケーラビリティを示すこと。
  • 外部エージェントとUnityベースの環境との間でシームレスに統合可能な、再利用可能なオープンプロトコル通信システムを提供すること。

提案手法

  • 高品質な視覚的表現とシミュレーションの正確性を備えた、多様な強化学習環境を構築するための柔軟なプラットフォームとして、Unityゲームエンジンを活用すること。
  • 外部エージェントとUnity環境を接続するためのカスタムでオープンソースの通信プロトコルを設計し、リアルタイムでの観測と行動のやり取りを可能にすること。
  • 事前にビルドされた環境とすべての依存関係をバンドルする標準化されたパッケージングアプローチを実装し、異なるシステム間での再現性を保証すること。
  • プログラマフレンドリーなツールと活発なコミュニティを活用し、環境開発を簡素化し、工学的負荷を低減すること。
  • 手続き的生成技術を用いて、環境間で変動する初期状態を生成し、一般化性能のテストを強化すること。
  • 複数の出版済み強化学習研究への統合を通じたフレームワークの妥当性を検証し、スケールに応じた互換性と性能を示すこと。

実験結果

リサーチクエスチョン

  • RQ1Unityは、既存のゲームベースプラットフォームの制限を超えて、多様な強化学習環境をスケーラブルかつ柔軟に構築するための基盤として効果的に再利用可能だろうか?
  • RQ2標準化されたパッケージングと依存関係管理により、強化学習研究における環境の再現性と配布性はどの程度向上できるか?
  • RQ3Unityベースの環境は、一般知能評価に求められる複雑で物理的要因を考慮した、記憶を必要とする強化学習タスクをどの程度サポートできるか?
  • RQ4統一された通信プロトコルの使用は、エージェントと多様なUnity環境間の相互運用性をどの程度向上させるか?
  • RQ5大規模な強化学習の学習・評価を実現するため、CPUまたはGPU上で複数の同時実行Unityインスタンスを実行する際の計算効率はどの程度か?

主な発見

  • 本フレームワークにより、13の多様で1人称視点、3次元の環境が、出版済みの強化学習研究で使用された。これらには記憶、ナビゲーション、物理的構築を含むタスクが含まれる。
  • Fortunato et al. (2019)の研究で使用された13の環境のうち8つが、本研究で提案するUnityベースのアプローチで構築されており、複雑で記憶を要するタスクへの適用可能性が裏付けられた。
  • Gregor et al. (2019)のRandom CityおよびVoxel Environmentは、手続き的に生成された3次元世界であり、信念状態モデリングとブロック操作タスクをサポートした。
  • Paine et al. (2019)の8つの難易度の高い探索タスクのスイートは、本フレームワークで構築されており、初期状態が大きく変動し、長時間スパンでの計画を要する特徴を持っていた。
  • Bapst et al. (2019)の2次元構築環境は、連続的かつ物理ベースのシミュレーションを用い、エージェントがブロックから構造物を構築する能力をテストした。エピソード終了条件はタスクの成功または衝突に基づいていた。
  • 本フレームワークは、CPUまたはGPU上で複数の同時実行Unityインスタンスを効率的に処理するのに十分な計算効率を達成しており、スケーラブルな学習と評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。