Skip to main content
QUICK REVIEW

[論文レビュー] Using Monte Carlo Tree Search as a Demonstrator within Asynchronous Deep RL

Bilal Kartal, Pablo Hernández-Leal|arXiv (Cornell University)|Nov 30, 2018
Reinforcement Learning in Robotics参考文献 40被引用数 7
ひとこと要約

本論文は、深層強化学習におけるサンプル効率性とポリシー品質の向上を目的として、新しい終端予測補助タスクを組み込んだ強化された非同期アドバンテージアーキテクト(A3C)手法、A3C-TPを提案する。さらに、A3C内にモンテカルロツリー探索(MCTS)をシミュレーテッド・デモンストレーターとして統合するフレームワークを導入し、より高速な学習と安全な探索を実現した。この手法は、2人用ミニPommerman環境において自殺行動を減少させ、性能を向上させることを実証した。

ABSTRACT

Deep reinforcement learning (DRL) has achieved great successes in recent years with the help of novel methods and higher compute power. However, there are still several challenges to be addressed such as convergence to locally optimal policies and long training times. In this paper, firstly, we augment Asynchronous Advantage Actor-Critic (A3C) method with a novel self-supervised auxiliary task, i.e. \emph{Terminal Prediction}, measuring temporal closeness to terminal states, namely A3C-TP. Secondly, we propose a new framework where planning algorithms such as Monte Carlo tree search or other sources of (simulated) demonstrators can be integrated to asynchronous distributed DRL methods. Compared to vanilla A3C, our proposed methods both learn faster and converge to better policies on a two-player mini version of the Pommerman game.

研究の動機と目的

  • Pommermanのような環境では、危険な行動(例:爆弾による自殺)が一般的であるが、報酬が疎で遅延するという深層強化学習の課題に対処すること。
  • 補助タスクの導入と計画ベースのデモンストレーターとの統合により、非同期的深層RLのサンプル効率性と収束速度を向上させること。
  • ポリシーネットワークの学習からMCTSベースの計画を分離し、性能向上を維持したまま非同期的かつオンポリシー学習を可能にすること。
  • 特に、終端予測ヘッドによって特定された高リスク状態において、MCTSをリアルタイムのデモンストレーターとして使用することで、より高速かつ安全な探索を実現すること。

提案手法

  • A3Cに自己教師付き補助タスクとして終端状態への時間的近接度を予測する終端予測を導入し、より安全な探索を促進する。
  • MCTSベースのプランナを主なA3C学習パイプラインから分離し、ポリシー学習のためのエキスパートライクなデモンストレーションを生成する独立したワーカーとして使用する。
  • MCTSが生成した行動をオンポリシー学習ループ内でデモンストレーションとして使用し、経験再生を一切使用せずにグローバルポリシーネットワークを非同期に更新する。
  • 終端予測ヘッドを統合し、終端状態への近接度が高い場合にMCTSベースのデモンストレーターを動的に起動することで、高リスク状態での即時の干渉を可能にする。
  • 経験再生を一切使用しない完全なオンポリシー学習スキームを維持し、MCTSが生成したすべての行動を一度だけ使用し、即時に破棄する。
  • A3Cのポリシーおよび価値ネットワークは標準的なアドバンテージアーキテクト更新を用い、終端予測ヘッドは終端状態までの時間的距離を目的変数として平均二乗誤差で学習する。

実験結果

リサーチクエスチョン

  • RQ1終端状態への時間的近接度を予測する自己教師付き補助タスクは、深層強化学習における学習速度とポリシー品質の向上に寄与するか?
  • RQ2共有ニューラルネットワークを必要としない非同期的深層RLフレームワーク(例:A3C)において、モンテカルロツリー探索(MCTS)をシミュレーテッド・デモンストレーターとして効果的に使用できるか?
  • RQ3MCTSベースの計画を統合することで、報酬の遅延と高い探索リスクを伴う環境におけるサンプル効率性の向上と、危険行動(例:自殺)の削減が可能か?
  • RQ4終端予測ヘッドは、学習中の高リスク状態(例:直近の自殺)を的確に特定し、MCTSデモンストレーターの即時の使用を誘発する信頼できるシグナルとして機能するか?
  • RQ5終端予測タスクとMCTSデモンストレーターの両方を統合したフレームワークは、ベーシックなA3CおよびA3C-TPと比較して、学習効率と最終的なポリシー性能において優れているか?

主な発見

  • 終端予測補助タスクを備えたA3C-TPは、2人用ミニPommerman環境において、ベーシックなA3Cと比較してより高速に学習し、より優れたポリシーに収束した。
  • MCTSをデモンストレーターとして統合することで、学習中の自殺エピソードの数が顕著に減少し、より安全な探索が実現した。
  • A3C-TPとMCTSデモンストレーターの統合フレームワーク(IM-A3C-TP)は、最も優れた性能を達成し、A3CおよびA3C-TP単体よりも高速に学習した。
  • 終端予測ヘッドは、自殺が間もなく起こるなど高リスク状態を的確に特定でき、MCTSデモンストレーターの的確な使用を可能にした。
  • 共有重みや経験再生を一切必要としない非同期的・オンポリシー設定において、計画と深層強化学習の有効な融合を実現した。
  • MCTSベースのデモンストレーターはルールベースの相手を上回り、分散型DRLシステムにおけるスケーラブルでブラックボックス型のコンponentsとしての可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。