Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchial Reinforcement Learning in StarCraft II with Human Expertise in Subgoals Selection.

Xinyi Xu, Tiancheng Huang|arXiv (Cornell University)|2020. 08. 08.
Reinforcement Learning in Robotics참고 문헌 28인용 수 5
한 줄 요약

이 논문은 복잡한 환경에서 샘플 효율성과 해석 가능성 향상을 위해 인간의 전문 지식을 하위목표 선택에 통합하는 계층적 강화학습 프레임워크를 제안한다. 인간이 설계한 하위목표와 경험 재생을 교육 과정 유사한 구조 안에서 활용함으로써, 이 방법은 스타크래프트 II 미니게임에서 평탄한 강화학습보다 뛰어난 성능을 달성하며 탐색 비용을 감소시키고 행동의 투명성을 향상시킨다.

ABSTRACT

This work is inspired by recent advances in hierarchical reinforcement learning (HRL) (Barto and Mahadevan 2003; Hengst 2010), and improvements in learning efficiency from heuristic-based subgoal selection, experience replay (Lin 1993; Andrychowicz et al. 2017), and task-based curriculum learning (Bengio et al. 2009; Zaremba and Sutskever 2014). We propose a new method to integrate HRL, experience replay and effective subgoal selection through an implicit curriculum design based on human expertise to support sample-efficient learning and enhance interpretability of the agent's behavior. Human expertise remains indispensable in many areas such as medicine (Buch, Ahmed, and Maruthappu 2018) and law (Cath 2018), where interpretability, explainability and transparency are crucial in the decision making process, for ethical and legal reasons. Our method simplifies the complex task sets for achieving the overall objectives by decomposing them into subgoals at different levels of abstraction. Incorporating relevant subjective knowledge also significantly reduces the computational resources spent in exploration for RL, especially in high speed, changing, and complex environments where the transition dynamics cannot be effectively learned and modelled in a short time. Experimental results in two StarCraft II (SC2) (Vinyals et al. 2017) minigames demonstrate that our method can achieve better sample efficiency than flat and end-to-end RL methods, and provides an effective method for explaining the agent's performance.

연구 동기 및 목표

  • 복잡하고 고차원적인 환경에서 강화학습의 샘플 비효율성 문제를 해결하기 위해.
  • 인간의 전문 지식을 통합하여 에이전트의 의사결정 과정의 해석 가능성과 투명성을 향상시키기 위해.
  • 인간 지식 기반의 구조적 하위목표 분해를 통해 계산적 탐색 비용을 감소시키기 위해.
  • 경험 재생과 암묵적 교육 과정 설계를 통합하여 학습 효율성을 향상시키기 위해.
  • 실제 복잡한 환경, 예를 들어 스타크래프트 II에서의 효과성을 입증하기 위해.

제안 방법

  • 이 방법은 복잡한 작업을 다중 추상 수준에서 하위목표로 분해하는 계층적 강화학습(HRL)을 활용한다.
  • 인간의 전문 지식을 활용해 의미 있고 효과적인 하위목표를 정의함으로써 무작위 탐색의 필요성을 줄인다.
  • 인간이 제공한 히وري스틱을 기반으로 하위목표 우선순위를 정함으로써 암묵적 교육 과정을 설정하여 에이전트가 체계적인 학습 단계를 거치도록 이끈다.
  • 학습 안정성 향상과 데이터 효율성 향상을 위해 계층적 의사결정 단계 전반에 경험 재생을 통합한다.
  • HRL과 교육 과정 학습 원리를 결합하여 인간 지식을 활용해 학습 궤적을 설계한다.
  • 하위목표 선택은 학습을 통해 처음부터 시작되지 않고 전문가의 입력에 의해 안내되므로 정책 탐색 공간이 단순화된다.

실험 결과

연구 질문

  • RQ1인간의 전문 지식이 하위목표 선택에 활용될 경우 계층적 강화학습의 샘플 효율성이 향상되는가?
  • RQ2인간이 설계한 하위목표를 통합할 경우 에이전트 행동의 해석 가능성은 어떻게 영향을 받는가?
  • RQ3경험 재생이 제안된 HRL 프레임워크에서 학습 안정성 향상에 얼마나 기여하는가?
  • RQ4인간 지식 기반의 암묵적 교육 과정이 복잡한 환경에서 무작위 또는 종단 간 강화학습보다 우월한가?
  • RQ5이 방법은 스타크래프트 II와 같은 탐색 비용이 높은 환경에서 계산 비용을 줄일 수 있는가?

주요 결과

  • 제안된 방법은 스타크래프트 II 미니게임에서 평탄한 강화학습 및 종단 간 강화학습 방법보다 더 뛰어난 샘플 효율성을 달성한다.
  • 하위목표 선택에 인간의 전문 지식을 통합함으로써 학습 과정에서의 탐색 부담이 크게 감소한다.
  • 구조적이고 인간이 안내한 하위목표의 계층 구조 덕분에 에이전트 행동이 더 해석 가능하고 투명해진다.
  • 경험 재생은 계층적 프레임워크에서 안정적인 학습과 향상된 데이터 활용도에 기여한다.
  • 인간 지식 기반의 암묵적 교육 과정은 복잡한 환경에서 더 빠른 수렴과 더 효과적인 학습을 가능하게 한다.
  • 이 방법은 모델 기반 계획이 불가능한 고속이고 동적인 환경에서도 효과를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.