Skip to main content
QUICK REVIEW

[논문 리뷰] Off-Policy Actor-Critic in an Ensemble: Achieving Maximum General Entropy and Effective Environment Exploration in Deep Reinforcement Learning

Gang Chen, Yiming Peng|arXiv (Cornell University)|2019. 02. 14.
Reinforcement Learning in Robotics참고 문헌 42인용 수 5
한 줄 요약

이 논문은 소프트 액터-크리틱(SAC)을 일반 엔트로피 측정법—티슬레스 엔트로피와 레니 엔트로피—를 최대화하도록 확장하는 새로운 정책 반복 이론을 제안한다. 이는 딥 강화학습에서 더 효과적인 탐색을 가능하게 한다. 이 방법은 TAC 및 RAC 알고리즘을 도입하며, 부트스트랩 기반 탐색과 Q-네트워크 기반 액션 선택을 통합한 앙상블 액터-크리틱(EAC)을 추가로 개발하여 여섯 가지 벤치마크 제어 과제에서 최신 기준 수준의 샘플 효율성과 성능을 달성하며, SAC 및 기타 최고의 알고리즘을 능가한다.

ABSTRACT

We propose a new policy iteration theory as an important extension of soft policy iteration and Soft Actor-Critic (SAC), one of the most efficient model free algorithms for deep reinforcement learning. Supported by the new theory, arbitrary entropy measures that generalize Shannon entropy, such as Tsallis entropy and Renyi entropy, can be utilized to properly randomize action selection while fulfilling the goal of maximizing expected long-term rewards. Our theory gives birth to two new algorithms, i.e., Tsallis entropy Actor-Critic (TAC) and Renyi entropy Actor-Critic (RAC). Theoretical analysis shows that these algorithms can be more effective than SAC. Moreover, they pave the way for us to develop a new Ensemble Actor-Critic (EAC) algorithm in this paper that features the use of a bootstrap mechanism for deep environment exploration as well as a new value-function based mechanism for high-level action selection. Empirically we show that TAC, RAC and EAC can achieve state-of-the-art performance on a range of benchmark control tasks, outperforming SAC and several cutting-edge learning algorithms in terms of both sample efficiency and effectiveness.

연구 동기 및 목표

  • 샤논 엔트로피 최대화로 인해 저보상 액션을 유지할 수 있는 SAC의 탐색 효율성 부족 문제를 해결하기 위해.
  • 연속적 액션 공간에서 티슬레스 및 레니 엔트로피와 같은 임의의 일반 엔트로피 측정법을 지원할 수 있도록 소프트 정책 반복을 확장하기 위해.
  • 부트스트랩 메커니즘을 통해 탐색을 향상시키고 고수준 액션 선택을 수행하는 새로운 앙상블 기반 액터-크리틱 프레임워크(EAC)를 개발하기 위해.
  • 엔트로피 정규화 알고리즘이 SAC 및 기타 최신 기술보다 더 높은 샘플 효율성과 성능을 달성하는지 경험적으로 검증하기 위해.

제안 방법

  • 티슬레스 및 레니 엔트로피 포함 임의의 엔트로피 측정법을 최대화할 수 있도록 소프트 액터-크리틱을 일반화하는 새로운 정책 반복 이론을 제안한다.
  • 티슬레스 엔트로피 최대화에 기반한 정책 최적화 목표를 설정하여 TAC 알고리즘을 개발하고, 레니 엔트로피 최대화에 기반한 RAC 알고리즘을 개발한다.
  • 각 정책가 티슬레스 또는 레니 엔트로피를 최대화하도록 훈련하는 정책의 앙상블을 도입하여 다양한 탐색 전략을 가능하게 한다.
  • 오스반드 등(2016)의 부트스트랩 메커니즘을 활용하여 앙상블 내에서 깊은 환경 탐색을 촉진한다.
  • 다양한 앙상블 정책의 권고를 통합하기 위해 밸류 함수 기반 Q-네트워크를 설계하여 고수준 액션 선택을 수행한다.
  • 재현 버퍼 재사용과 타겟 네트워크를 활용한 오프-폴리시 학습을 사용하여 훈련을 안정화시키며, SAC의 프레임워크를 따르되 일반화된 엔트로피 목표를 적용한다.

실험 결과

연구 질문

  • RQ1티슬레스 및 레니 엔트로피와 같은 일반 엔트로피 측정법을 최대화하는 것이 연속 제어 과제에서 샤논 엔트로피 최대화보다 더 효과적인 탐색을 이끌 수 있는가?
  • RQ2티슬레스 및 레니 엔트로피 기반 정책는 샘플 효율성과 최종 성능 측면에서 SAC와 비교해 어떻게 성능을 내는가?
  • RQ3다른 엔트로피 측정법을 사용해 훈련된 정책의 앙상블은 개별 에이전트를 초월해 탐색과 학습 성능을 향상시킬 수 있는가?
  • RQ4엔트로피 지수(q 또는 η)가 다양한 환경에서 TAC 및 RAC의 성능에 미치는 영향은 무엇인가?
  • RQ5부트스트랩 탐색과 Q-네트워크 기반 액션 선택을 통합한 제안된 EAC 프레임워크는 우수한 성능과 강건성을 달성하는가?

주요 결과

  • TAC, RAC, EAC는 여섯 가지 벤치마크 제어 과제에서 최신 기준 수준의 성능을 달성하며, 샘플 효율성과 최종 성능 모두에서 SAC 및 기타 최고의 알고리즘을 능가한다.
  • 티슬레스 및 레니 엔트로피 기반으로 훈련된 정책의 앙상블을 포함한 EAC 알고리즘은 Ant 및 하프 체타 등 복잡한 환경에서 특히 뚜렷한 성능 향상을 보였다.
  • 적절하게 캘리브레이션된 엔트로피 지수(예: q=1.5 또는 η=1.5)는 기준 SAC보다 더 뛰어난 성능을 내며, 최적의 값은 문제에 따라 달라진다.
  • 루나 랜더 과제에서는 η=2.0을 사용한 RAC가 최고의 성능을 기록하여, 최적의 엔트로피 지수 값이 환경의 역학에 따라 달라질 수 있음을 시사한다.
  • 부트스트랩 탐색과 Q-네트워크 기반 액션 선택을 통합한 앙상블 기반 EAC 프레임워크는 단일 에이전트 기반 베이스라인 대비 학습 안정성과 샘플 효율성을 크게 향상시켰다.
  • 모든 제안된 알고리즘은 하이퍼파rameter 설정에 대해 강건하며, 각 벤치마크에서 10개의 랜덤 시드에 걸쳐 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.