Skip to main content
QUICK REVIEW

[論文レビュー] MiniHack the Planet: A Sandbox for Open-Ended Reinforcement Learning Research

Mikayel Samvelyan, Robert Kirk|arXiv (Cornell University)|Sep 27, 2021
Reinforcement Learning in Robotics被引用数 11
ひとこと要約

MiniHack は、NetHack の豊富なグリッドワールドメカニクスを基盤に、人間が読みやすい DSL や Python API を通じて、複雑で手続き的に生成された環境の迅速なプロトタイピングを可能にする柔軟でオープンエンドの強化学習(RL)サンドボックスです。既存のベンチマークの統合、マルチモーダル観測、高度な RL タスクのサポートを可能とし、DQN、PPO、A2C などのベースラインを用いて、ナビゲーション、スキル習得、自己教師付き環境設計の分野で最先端の性能を示しています。

ABSTRACT

Progress in deep reinforcement learning (RL) is heavily driven by the availability of challenging benchmarks used for training agents. However, benchmarks that are widely adopted by the community are not explicitly designed for evaluating specific capabilities of RL methods. While there exist environments for assessing particular open problems in RL (such as exploration, transfer learning, unsupervised environment design, or even language-assisted RL), it is generally difficult to extend these to richer, more complex environments once research goes beyond proof-of-concept results. We present MiniHack, a powerful sandbox framework for easily designing novel RL environments. MiniHack is a one-stop shop for RL experiments with environments ranging from small rooms to complex, procedurally generated worlds. By leveraging the full set of entities and environment dynamics from NetHack, one of the richest grid-based video games, MiniHack allows designing custom RL testbeds that are fast and convenient to use. With this sandbox framework, novel environments can be designed easily, either using a human-readable description language or a simple Python interface. In addition to a variety of RL tasks and baselines, MiniHack can wrap existing RL benchmarks and provide ways to seamlessly add additional complexity.

研究の動機と目的

  • 単純で制御された RL 環境と複雑な現実世界のベンチマークの間のギャップを埋めるために、体系的でスケーラブルな環境設計を可能にすること。
  • 研究者が仮説検証を維持したまま、段階的に環境の複雑さを高めることを可能にするフレームワークを提供すること。
  • 自己教師付きスキル発見、トランスファー学習、言語支援型 RL などの多様な RL 研究分野を、豊富で拡張可能な環境を通じて支援すること。
  • NetHack のエントイティとダイナミクスを活用して、既存のベンチマーク(例:MiniGrid、Boxoban)を容易に移植・拡張できること。
  • DQN、PPO、A2C の標準ベースラインとトレーニング設定を提供し、今後の研究を加速させること。

提案手法

  • フレームワークは、人間が読みやすい des ファイルを通じて、NetHack のドメイン固有言語(DSL)を用いて手続き的に生成された環境を定義し、最小限のコードで迅速な環境作成を可能にします。
  • これらの記述を標準の Gym 互換 RL 環境にコンパイルし、シンボリック観測、ピクセルベース観測、テキスト観測をサポートします。
  • NetHack エントイティ(例:モンスター、ドア、溶岩)を挿入し、わずか数行のコードで既存のベンチマークを拡張可能で、確率的ダイナミクスを統合できます。
  • マルチエージェントおよびアドバーシャルトレーニングをサポートし、LSTM ベースのポリシー網を用いたアドバーシーとプロトコルの両者で、PAIRED アルゴリズムによる自己教師付き環境設計を実現します。
  • 人気のある RL ライブラリ(例:RLlib、TorchBeast)と統合可能で、ベースライン手法のための事前設定済みトレーニングスクリプトとハイパーパramータを提供します。
  • LSTM を含む再帰的ネットワークと、優先順位付き経験リプレイや価値関数クリッピングといった標準的な RL 要素をサポートするエンドツーエンドのトレーニングを可能にします。

実験結果

リサーチクエスチョン

  • RQ1モジュラーで拡張可能なフレームワークは、実験的制御を維持したまま、単純な環境から複雑な環境へ体系的にスケーリングアップするのを可能にできるか?
  • RQ2NetHack の豊富で動的なエントイティを追加することで、既存のベンチマークを大幅な工学的負担なしに拡張できるか?
  • RQ3MiniHack は、自己教師付き環境設計やマルチモーダル観測学習といった高度な RL 研究をどれほど効果的に支援できるか?
  • RQ4MiniHack は、探索、クレジット割り当て、トランスファー学習といった多様な RL 能力を評価する統合的プラットフォームとして機能できるか?
  • RQ5標準的な RL アルゴリズム(DQN、PPO、A2C)は、MiniHack のナビゲーションおよびスキル習得タスクのスイートでどれほど性能を発揮するか?

主な発見

  • DQN、PPO、A2C を用いたベースラインエージェントは、MiniHack のナビゲーションおよびスキル習得タスクで安定した学習曲線を示し、500,000 ステップを超えて中央値リターンが向上しました。
  • PAIRED アルゴリズムは、PPO で訓練されたアドバーシー ポリシーを用いて、Novel で挑戦的なレベルを自動生成し、自己教師付き環境設計の実現可能性を示しました。
  • MiniGrid や Boxoban からの移植済み環境が、MiniHack に正常に統合され、NetHack エントイティで拡張されたことで、フレームワークの相互運用性が実証されました。
  • MiniHack におけるマルチモーダル観測(シンボリック、ピクセル、テキスト)の使用により、より豊かな状態表現が可能になり、複雑な推論タスクをサポートしました。
  • 1 GPU と 10 コアの CPU を用いたトレーニングで、効率的なウォールクロックスピードが達成され、すべてのアルゴリズムで安定した学習が可能になるようにハイパーパramータが最適化されました。
  • フレームワークのモジュラー設計により、迅速な環境作成が可能となり、たとえば 10 行未満の DSL コードで複雑な迷路や通路システムを生成できました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。