Skip to main content
QUICK REVIEW

[논문 리뷰] Effective Exploration for Deep Reinforcement Learning via Bootstrapped Q-Ensembles under Tsallis Entropy Regularization

Gang Chen, Yiming Peng|arXiv (Cornell University)|2018. 09. 02.
Reinforcement Learning in Robotics참고 문헌 35인용 수 8
한 줄 요약

이 논문은 타슬리 엔트로피 정규화를 통한 부스터랩드 Q-앙상블(BQETR)을 제안한다. 이는 타슬리 엔트로피 정규화와 부스터랩드 Q-네트워크 앙상블을 결합하여 탐색을 향상시키는 딥 강화학습 알고리즘이다. 일반적인 타슬리 엔트로피 형태를 사용해 확률적 정책 학습을 이끌고, 각 Q-네트워크에서 정규화 파라미터를 다르게 설정함으로써 기존의 부스터랩드 DQN과 UCB Q-앙상블과 비교해 더 효과적이고 샘플 효율적인 탐색을 달성한다. 이는 아타리 게임에서 성과를 보였다.

ABSTRACT

Recently deep reinforcement learning (DRL) has achieved outstanding success on solving many difficult and large-scale RL problems. However the high sample cost required for effective learning often makes DRL unaffordable in resource-limited applications. With the aim of improving sample efficiency and learning performance, we will develop a new DRL algorithm in this paper that seamless integrates entropy-induced and bootstrap-induced techniques for efficient and deep exploration of the learning environment. Specifically, a general form of Tsallis entropy regularizer will be utilized to drive entropy-induced exploration based on efficient approximation of optimal action-selection policies. Different from many existing works that rely on action dithering strategies for exploration, our algorithm is efficient in exploring actions with clear exploration value. Meanwhile, by employing an ensemble of Q-networks under varied Tsallis entropy regularization, the diversity of the ensemble can be further enhanced to enable effective bootstrap-induced exploration. Experiments on Atari game playing tasks clearly demonstrate that our new algorithm can achieve more efficient and effective exploration for DRL, in comparison to recently proposed exploration methods including Bootstrapped Deep Q-Network and UCB Q-Ensemble.

연구 동기 및 목표

  • 딥 강화학습(DRL)에서의 높은 샘플 비용 문제를 해결하기 위해 탐색 효율성을 향상시키기 위해.
  • 기존 방법에서의 행동 와이드링과 신뢰도 기반 탐색의 한계를 극복하기 위해.
  • 통합된 프레임워크를 통해 엔트로피 유도 탐색과 부스터랩드 유도 탐색을 원활하게 통합하기 위해.
  • 더 집중적이고 효과적인 탐색을 위해 타슬리 엔트로피 정규화를 활용하는 새로운 알고리즘을 개발하기 위해.
  • 기준 아타리 환경에서 뛰어난 샘플 효율성과 성능을 입증하기 위해.

제안 방법

  • 타슬리 엔트로피 정규화의 일반형을 도입하여, 높은 탐색 가치를 가진 행동을 우선시하는 최적의 확률적 정책을 유도한다.
  • 각기 다른 타슬리 엔트로피 파라미터 $q$를 가진 Q-네트워크 앙상블을 사용하여 다양성과 부스터랩드 유도 탐색을 향상시킨다.
  • 계산적으로 효율적인 최적 정책의 근사치를 사용하여 타슬리 정규화 하에서의 비가역 계산을 피한다.
  • 학습이 진행됨에 따라 정규화 계수 $\alpha$를 점차 0으로 감소시켜 탐색에서 이용으로의 부드러운 전환을 유도한다.
  • 벨만 잔여 분석을 통해 근사치가 최종 성능을 떨어뜨리지 않음을 입증한다.
  • 엔트로피 기반 행동 선택과 앙상블 샘플링을 결합하여, 무작위 초기화에만 의존하지 않고 깊은 수준의 탐색을 달성한다.

실험 결과

연구 질문

  • RQ1타슬리 엔트로피 정규화는 샤논 엔트로피나 행동 와이드링에 비해 딥 강화학습에서 탐색 효율성을 향상시킬 수 있는가?
  • RQ2타슬리 엔트로피 정규화를 부스터랩드 Q-앙상블과 조합함으로써 탐색 다양성과 성능이 어떻게 향상되는가?
  • RQ3제안된 BQETR 알고리즘이 아타리 게임에서 부스터랩드 DQN과 UCB Q-앙상블보다 더 뛰어난 샘플 효율성을 달성하는가?
  • RQ4정규화 계수 $\alpha$를 점차 감소시키는 것이 정책 수렴과 성능에 어떤 영향을 미치는가?
  • RQ5타슬리 엔트로피의 일반형은 낮은 가치의 행동에 대해 균일하지 않은 탐색 질량 문제를 피할 수 있는가?

주요 결과

  • BQETR는 아타리 게임 벤치마크에서 부스터랩드 DQN과 UCB Q-앙상블보다 더 효과적이고 효율적인 탐색을 달성한다.
  • 타슬리 엔트로피 정규화를 사용함으로써 낮은 탐색 가치 행동에 대한 비균일한 확률 질량이 감소하여, 유망한 행동에 집중하는 데 기여한다.
  • 벨만 잔여 분석을 통해 타슬리 정규화 하에서 최적 정책의 근사치가 성능 유지에 기여함을 입증했다.
  • 정규화 계수 $\alpha$의 점진적 감소는 탐색에서 이용으로의 부드러운 전환을 가능하게 한다.
  • Q-네트워크 간의 $q$ 파라미터 다양성으로 앙상블의 다양성이 향상되어 부스터랩드 유도 탐색이 향상된다.
  • 실험 결과는 BQETR가 샘플 효율성과 효과성 측면에서 모두 뛰어나며, 아타리에서 최신 탐색 방법을 능가함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.