Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning with Structured Hierarchical Grammar Representations of Actions

Petros Christodoulou, Robert Tjarko Lange|arXiv (Cornell University)|2019. 10. 07.
Reinforcement Learning in Robotics참고 문헌 19인용 수 4
한 줄 요약

이 논문은 에이전트 행동에서 계층적 매크로행동을 문법 유추를 통해 발견함으로써 딥 강화학습의 샘플 효율성을 향상시키는 Action Grammar Reinforcement Learning (AG-RL) 프레임워크를 소개한다. 이러한 학습된 매크로행동을 행동 공간에 통합함으로써 AG-RL은 20개의 Atari 게임에서 성능을 향상시켰으며, SAC 대비 샘플 효율성에서 중앙값 기준 +96%의 향상과 최대 +3,756%의 향상을 기록했고, 광범위한 초모수 조정 없이도 20개 게임 중 17개에서 최신 기술을 능가했다.

ABSTRACT

From a young age humans learn to use grammatical principles to hierarchically combine words into sentences. Action grammars is the parallel idea, that there is an underlying set of rules (a "grammar") that govern how we hierarchically combine actions to form new, more complex actions. We introduce the Action Grammar Reinforcement Learning (AG-RL) framework which leverages the concept of action grammars to consistently improve the sample efficiency of Reinforcement Learning agents. AG-RL works by using a grammar inference algorithm to infer the "action grammar" of an agent midway through training. The agent's action space is then augmented with macro-actions identified by the grammar. We apply this framework to Double Deep Q-Learning (AG-DDQN) and a discrete action version of Soft Actor-Critic (AG-SAC) and find that it improves performance in 8 out of 8 tested Atari games (median +31%, max +668%) and 19 out of 20 tested Atari games (median +96%, maximum +3,756%) respectively without substantive hyperparameter tuning. We also show that AG-SAC beats the model-free state-of-the-art for sample efficiency in 17 out of the 20 tested Atari games (median +62%, maximum +13,140%), again without substantive hyperparameter tuning.

연구 동기 및 목표

  • 희소 보상 환경에서 특히 악영향을 미치는 딥 강화학습의 낮은 샘플 효율성 문제를 해결한다.
  • 언어 문법과 행동 계층 간의 생물학적 및 인지적 유사성을 활용하여 학습 효율성과 해석 가능성 향상을 도모한다.
  • 학습 중에 자동으로 구조적이고 계층적인 매크로행동을 발견하고 에이전트의 행동 공간에 통합하는 방법을 개발한다.
  • 문법 기반 매크로행동이 다양한 Atari 환경에서 광범위한 초모수 조정 없이도 성능 향상에 크게 기여함을 입증한다.
  • 학습 안정성과 데이터 효율성을 향상시키기 위해 일반화 가능한 기법들인 Hindsight Action Replay와 Abandon Ship을 도입한다.

제안 방법

  • 고정된 단계 수 후에 에이전트의 행동 시퀀스를 수집하고, 반복적으로 나타나는 구조적 행동 패턴을 식별하기 위해 문법 유추 알고리즘을 적용한다.
  • 식별된 행동 시퀀스를 시간적 추상화로 변환하여 고수준 행동을 나타내는 매크로행동으로 전환함으로써 원시 행동을 복합적이고 재사용 가능한 단위로 조합한다.
  • 발견된 매크로행동을 에이전트의 원래 행동 공간에 통합하여 계속되는 학습 중에 선택할 수 있도록 한다.
  • Hindsight Action Replay (HAR)를 사용하여 매크로행동에서 얻은 경험을 재사용함으로써 데이터 효율성을 향상시킨다. 이는 원래 목표를 달성하지 못한 경우에도 유효하다.
  • Abandon Ship 기법을 구현하여 장기 매크로행동 학습 중의 분산을 줄이고, 실패 시 조기 종료를 允허함으로써 학습 안정성을 향상시킨다.
  • 전이 학습을 활용하여 네트워크를 재조정하는 방식으로, DDQN 및 SAC 에이전트 모두에 프레임워크를 적용한다 (AG-DDQN 및 AG-SAC).

실험 결과

연구 질문

  • RQ1에이전트 행동에서 도출된 계층적 행동 문법이 딥 강화학습의 샘플 효율성 향상에 기여할 수 있는가?
  • RQ2수동으로 설계된 또는 반복적인 원시 행동과 비교할 때, 문법 기반 매크로행동은 성능 및 환경 간 일반화 능력에서 어떤가?
  • RQ3제안된 기법들인 Hindsight Action Replay와 Abandon Ship은 장기 매크로행동을 사용할 때 학습 안정성과 데이터 효율성을 어느 정도 향상시키는가?
  • RQ4AG-RL 프레임워크는 다양한 Atari 게임에서 표준 RL 에이전트 및 최신 기술 대비 샘플 효율성에서 일관되게 슈퍼리어한 성능을 보일 수 있는가?
  • RQ5이 프레임워크는 광범위한 초모수 조정 없이도 가치 기반(DDQN) 및 정책 기반(SAC) RL 알고리즘 모두에 효과적으로 적용될 수 있는가?

주요 결과

  • AG-DDQN를 사용해 테스트한 8개의 Atari 게임 전부에서 성능 향상을 기록했으며, DDQN 대비 샘플 효율성에서 중앙값 기준 +31% 향상과 최대 +668% 향상되었다.
  • AG-SAC는 SAC 대비 19개 게임 중 20개에서 샘플 효율성에서 중앙값 기준 +96% 향상과 최대 +3,756% 향상되었으며, 초모수 조정을 최소로 유지했다.
  • AG-SAC는 샘플 효율성에서 모델-프리 최신 기술을 20개 게임 중 17개에서 능가했으며, 중앙값 기준 +62% 향상과 최대 +13,140% 향상된 바 있다.
  • Abandon Ship 기법은 훈련 분산을 크게 감소시켜 100단위 이상의 시간 스텝을 초과하는 매크로행동을 효과적으로 학습할 수 있도록 했다.
  • Hindsight Action Replay는 성능 향상에 결정적인 역할을 하였으며, 이를 제거할 경우 AG-DDQN의 성능은 표준 DDQN과 다를 바 없었고, 경험 재사용 최적화의 중요성을 보여주었다.
  • 평균적으로 평가 중 에이전트는 길이 6.9의 매크로행동을 실행했으며(원시 행동 전용 대비 1.0), 고수준 행동의 광범위한 사용을 보였고, 매크로행동 길이는 2에서 100 이상의 시간 스텝에 이르렀다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.