Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchial Reinforcement Learning in StarCraft II with Human Expertise in Subgoals Selection.

Xinyi Xu, Tiancheng Huang|arXiv (Cornell University)|Aug 8, 2020
Reinforcement Learning in Robotics参考文献 28被引用数 5
ひとこと要約

本論文は、複雑な環境におけるサンプル効率性と解釈可能性を向上させるために、人間の専門知識を部分的目標選択に統合する階層的強化学習フレームワークを提案する。カリキュラムに類似した構造内での人間が設計した部分的目標と経験再生を活用することで、StarCraft II のミニゲームにおいてフラットなRLより優れた性能を達成し、探索コストを低減するとともに、行動の透明性を向上させる。

ABSTRACT

This work is inspired by recent advances in hierarchical reinforcement learning (HRL) (Barto and Mahadevan 2003; Hengst 2010), and improvements in learning efficiency from heuristic-based subgoal selection, experience replay (Lin 1993; Andrychowicz et al. 2017), and task-based curriculum learning (Bengio et al. 2009; Zaremba and Sutskever 2014). We propose a new method to integrate HRL, experience replay and effective subgoal selection through an implicit curriculum design based on human expertise to support sample-efficient learning and enhance interpretability of the agent's behavior. Human expertise remains indispensable in many areas such as medicine (Buch, Ahmed, and Maruthappu 2018) and law (Cath 2018), where interpretability, explainability and transparency are crucial in the decision making process, for ethical and legal reasons. Our method simplifies the complex task sets for achieving the overall objectives by decomposing them into subgoals at different levels of abstraction. Incorporating relevant subjective knowledge also significantly reduces the computational resources spent in exploration for RL, especially in high speed, changing, and complex environments where the transition dynamics cannot be effectively learned and modelled in a short time. Experimental results in two StarCraft II (SC2) (Vinyals et al. 2017) minigames demonstrate that our method can achieve better sample efficiency than flat and end-to-end RL methods, and provides an effective method for explaining the agent's performance.

研究の動機と目的

  • 複雑で高次元の環境における強化学習のサンプル非効率性の課題に対処すること。
  • 人間の専門知識を統合することで、エージェントの意思決定の解釈可能性と透明性を向上させること。
  • 人間の知識に基づく構造的な部分的目標分解を通じて、計算コストの高い探索コストを低減すること。
  • 経験再生と暗黙のカリキュラム設計の統合により、学習効率を向上させること。
  • 実世界の複雑な環境、たとえばStarCraft II における有効性を実証すること。

提案手法

  • 本手法は、複雑なタスクを複数の抽象度レベルでの部分的目標に分解する階層的強化学習(HRL)を採用する。
  • 意味的かつ効果的な部分的目標を定義するために人間の専門知識が用いられ、ランダムな探索の必要性が低減される。
  • 人間が提供するヒューリスティクスに基づいて部分的目標を優先順位付けすることで、暗黙のカリキュラムが構築され、エージェントが構造的な学習段階を経るよう導かれる。
  • 学習の安定性とデータ効率性を向上させるために、経験再生が階層的意思決定段階全体に統合される。
  • HRL とカリキュラム学習の原則を組み合わせ、人間の知識によって学習の軌道を形作るフレームワークが構築される。
  • 部分的目標選択は、学習からではなく専門家の入力を通じてガイドされるため、ポリシー探索空間が単純化される。

実験結果

リサーチクエスチョン

  • RQ1人間の専門知識による部分的目標選択は、階層的強化学習におけるサンプル効率性を向上させ得るか?
  • RQ2人間が設計した部分的目標を統合することで、エージェント行動の解釈可能性にどのような影響を与えるか?
  • RQ3経験再生は、提案されたHRLフレームワークにおける学習安定性をどの程度向上させるか?
  • RQ4人間の知識に基づく暗黙のカリキュラムは、ランダム探索やエンドツーエンドRLに比べ、複雑な環境で優れた性能を発揮するか?
  • RQ5この手法は、探索が集中的な環境、たとえばStarCraft II における計算コストを低減できるか?

主な発見

  • 提案手法は、StarCraft II のミニゲームにおいて、フラットなRLおよびエンドツーエンドRL手法よりも優れたサンプル効率性を達成した。
  • 部分的目標選択に人間の専門知識を統合することで、学習中の探索負荷が顕著に低減された。
  • 人間がガイドする構造的な部分的目標の階層的構造のおかげで、エージェントの行動がより解釈可能かつ透明になった。
  • 経験再生は、階層的フレームワークにおける安定した学習とデータ利用効率の向上に寄与した。
  • 人間の知識に基づく暗黙のカリキュラムにより、複雑な環境での収束が早まり、より効果的な学習が可能になった。
  • モデルベースの計画が非現実的な高速で動的な環境においても、本手法の有効性が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。