Skip to main content
QUICK REVIEW

[論文レビュー] Safer Deep RL with Shallow MCTS: A Case Study in Pommerman

Bilal Kartal, Pablo Hernández-Leal|arXiv (Cornell University)|Apr 10, 2019
Reinforcement Learning in Robotics参考文献 51被引用数 5
ひとこと要約

本論文は、挑戦的なPommermanマルチエージェント環境におけるサンプル効率と安全性を向上させるために、非熟練のデモンストレーターとして浅いモンテカルロツリー探索(MCTS)を非同期分散型ディープ強化学習(A3C)に統合することを提案する。軽量なMCTSを用いて探索をガイドし、学習中の深刻な自殺行動(自爆)を低減することで、より高速な収束と優れた方策を達成しており、vanilla DRLに比べて顕著な改善が得られている。これは、たとえ弱いプランナであっても、報酬が疎で遅延が生じる環境において安全な学習を著しく向上させられることを示している。

ABSTRACT

Safe reinforcement learning has many variants and it is still an open research problem. Here, we focus on how to use action guidance by means of a non-expert demonstrator to avoid catastrophic events in a domain with sparse, delayed, and deceptive rewards: the recently-proposed multi-agent benchmark of Pommerman. This domain is very challenging for reinforcement learning (RL) --- past work has shown that model-free RL algorithms fail to achieve significant learning. In this paper, we shed light into the reasons behind this failure by exemplifying and analyzing the high rate of catastrophic events (i.e., suicides) that happen under random exploration in this domain. While model-free random exploration is typically futile, we propose a new framework where even a non-expert simulated demonstrator, e.g., planning algorithms such as Monte Carlo tree search with small number of rollouts, can be integrated to asynchronous distributed deep reinforcement learning methods. Compared to vanilla deep RL algorithms, our proposed methods both learn faster and converge to better policies on a two-player mini version of the Pommerman game.

研究の動機と目的

  • モデルフリーのディープ強化学習がPommerman環境で探索中に発生する深刻な失敗(特に自爆)の課題に対処すること。
  • 非熟練で浅いMCTSプランナが、困難な探索と疎い報酬のドメインにおいて、ディープRLエージェントの行動ガイドとして有効に機能するかどうかを調査すること。
  • A3CとMCTSベースのデモンストレーターからの補助的アシスト学習を組み合わせることで、ディープRLのサンプル効率と学習速度を向上させること。
  • たとえ低品質なプランナであっても、複雑なマルチエージェント環境において自爆行動の回数を顕著に減らし、方策の収束を加速できることを示すこと。

提案手法

  • ベースとなるディープ強化学習アルゴリズムとして非同期アドバンテージアクターキャリブレーター(A3C)を採用し、一部のワーカーをMCTSベースのプランナに置き換え、行動のガイドラインを提供する。
  • モデルフリーのワーカーがMCTSデモンストレーターの行動を模倣するよう促す補助的アシスト学習損失を導入し、探索の安全性を向上させる。
  • 高い計算コストを回避するため、少数のロールアウト(例:10~50)で実行される軽量なMCTSを用い、非熟練のデモンストレーションを生成する。
  • 経験リプレイに依存しないオンポリシー学習の設定を維持し、MCTSが生成した行動が1回の更新ごとに一度だけ使用されるようにすることで、学習の一貫性を保つ。
  • エージェントの位置、爆弾、炎、壁、パワーインベントリ、および爆弾半径やキック能力といったエージェント固有の特性をエンコードする28の特徴マップを用いて、環境状態を表現する。
  • 4層の畳み込み層(32フィルタ、3×3、ストライド1、パディング1)、128ユニットの全結合層、およびアクター(行動確率)とクライアント(価値推定)の2つのヘッドを持つ共有の深層ニューラルネットワークを用いる。

実験結果

リサーチクエスチョン

  • RQ1限定的なロールアウト数(例:10~50)を持つ浅いMCTSプランナでさえ、Pommerman環境における学習中の深刻な自爆行動の発生率を顕著に低減できるか?
  • RQ2模倣学習を介して非熟練デモンストレーターを統合することで、報酬が疎く欺瞞的である状況下でのモデルフリーのディープRLのサンプル効率と収束速度が向上するか?
  • RQ3MCTSデモンストレーターの数と品質は、ディープRLエージェントの学習パフォーマンスと方策品質にどのように影響するか?
  • RQ4経験リプレイに依存しないで、オンポリシーのA3C学習が、軽量なプランナからの補助的模倣によって効果的に向上できるか?

主な発見

  • 提案手法は、vanilla DRLがPommermanで直面する主な失敗モード(自爆)の発生回数を顕著に削減した。
  • 浅いMCTSをデモンストレーターとして統合することで、最小限のハイパーパrameterチューニングで、標準的なA3Cに比べてより高速な学習と高い最終的な累積報酬を達成した。
  • わずか10~50回のMCTSロールアウトですら、方策パフォーマンスの向上に寄与しており、優れた計画能力が行動ガイドに必要ではないことを示している。
  • 異なる相手に対してより良い一般化性能を示しており、マルチエージェント相互作用における耐性と安全性の向上が裏付けられた。
  • MCTSの行動を用いた補助的模倣損失の導入により、学習曲線がより安定し、とくにAdam最適化器のε値を小さくした場合に顕著な危機的忘却の低減が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。