Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-based Distributional Policy Gradient

Rahul Singh, Keuntaek Lee|arXiv (Cornell University)|2020. 01. 08.
Reinforcement Learning in Robotics참고 문헌 27인용 수 7
한 줄 요약

이 논문은 재현가능한 노이즈 샘플을 사용하여 수익 분포를 모델링하는 새로운 액터-크리틱 강화학습 알고리즘인 샘플 기반 분포 정책 기울기(SDPG)를 제안한다. 기존의 이산 카테고리적 또는 히스토그램 표현 방식이 아닌, 재현가능한 노이즈 샘플을 활용함으로써, OpenAI Gym 라이브러리의 여러 연속 제어 환경에서 D4PG보다 뛰어난 샘플 효율성과 더 높은 평균 수익을 달성한다.

ABSTRACT

Distributional reinforcement learning (DRL) is a recent reinforcement learning framework whose success has been supported by various empirical studies. It relies on the key idea of replacing the expected return with the return distribution, which captures the intrinsic randomness of the long term rewards. Most of the existing literature on DRL focuses on problems with discrete action space and value based methods. In this work, motivated by applications in robotics with continuous action space control settings, we propose sample-based distributional policy gradient (SDPG) algorithm. It models the return distribution using samples via a reparameterization technique widely used in generative modeling and inference. We compare SDPG with the state-of-art policy gradient method in DRL, distributed distributional deterministic policy gradients (D4PG), which has demonstrated state-of-art performance. We apply SDPG and D4PG to multiple OpenAI Gym environments and observe that our algorithm shows better sample efficiency as well as higher reward for most tasks.

연구 동기 및 목표

  • 기존의 연속 행동 공간 설정에서의 분포 정책 강화학습(DRL) 방법의 한계, 특히 D4PG와 같은 알고리즘에서 나타나는 샘플 비효율성과 고정 해상도의 가치 분포 표현 방식을 해결하기 위해.
  • 이산화 및 투영을 피하기 위해 재현가능한 샘플을 활용한 수익 분포를 사용하는 DRL 프레임워크 내의 정책 기울기 방법을 개발하기 위해.
  • 사전에 수익의 범위를 알지 못해도 고해상도이고 민감한 수익 분포 모델링이 가능하도록 하여 샘플 효율성과 최종 성능을 향상시키기 위해.
  • 재현가능한 샘플을 통한 샘플 기반 수익 분포 학습이 이산 카테고리적 표현보다 더 우수한 일반화 능력과 더 빠른 수렴 속도를 제공하는지 입증하기 위해.

제안 방법

  • SDPG는 단순한 노이즈 분포(예: 정규분포)에서 수익 분포 샘플을 생성하기 위해 재현가능한 기법을 사용하여, 미분 가능한 샘플링과 종단 간 훈련을 가능하게 한다.
  • 크리틱 네트워크는 양자 히버 손실의 변종을 사용하여 훈련되며, 이는 학습된 분포와 목표 분포를 비교하는 워샤르 거리의 대체 지표로 작용한다.
  • 알고리즘은 액터-크리틱 프레임워크를 따르며, 액터 네트워크는 정책을 매개변수화하고, 크리틱 네트워크는 샘플된 수익에 적용된 분포 정책 벨만 방정식을 통해 목표 수익 분포를 근사한다.
  • 수익 분포는 샘플을 통해 암묵적으로 표현되며, 고정된 이산화 없이 훈련 후 임의의 해상도로 재구성 가능하다.
  • 이 방법은 수익의 범위에 대한 도메인 지식이 필요 없으며, D4PG에서 요구되는 투영 단계를 제거함으로써 훈련 복잡도를 낮춘다.
  • 훈련 과정은 크리틱의 샘플된 수익 분포와 분포 정책 벨만 업데이트로부터 유도된 목표 분포 사이의 양자 히버 손실을 최소화하는 방식으로 이루어진다.

실험 결과

연구 질문

  • RQ1DRL에서 샘플 기반 수익 분포 표현 방식이 D4PG와 같은 이산 카테고리적 방법보다 연속 제어 과제에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2노이즈 샘플의 재현가능성 처리가 고정 해상도의 카테고리적 또는 양자 표현 방식보다 더 표현력 있고 민감한 수익 분포 모델링을 가능하게 하는가?
  • RQ3투영 단계와 수익의 범위에 대한 사전 지식이 없이도 분포 정책 강화학습에서 더 우수한 일반화 능력과 훈련 안정성을 달성할 수 있는가?
  • RQ4샘플된 수익의 수가 정책 기울기 알고리즘의 성능과 수렴 속도에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 최신의 DRL 정책 기울기 기반 알고리즘보다 더 높은 평균 수익과 더 빠른 학습 진전을 달성하는가?

주요 결과

  • SDPG는 평가된 모든 환경에서 D4PG보다 뚜렷한 샘플 효율성을 확보했으며, 목표 수익 임계치에 도달하기 위해 훨씬 적은 에피소드를 필요로 하였다.
  • Pendulum-v1 환경에서 SDPG는 평균 481 에피소드 만에 -150의 수익 임계치에 도달했으며, D4PG는 1,605 에피소드가 소요되었다.
  • Reacher-v2 환경에서 SDPG는 -7의 수익에 도달하기 위해 11,859 에피소드가 필요했고, D4PG는 36,623 에피소드가 소요되었다.
  • HalfCheetah-v2 환경에서 SDPG는 1.0×10⁶ 스텝 후 평균 수익 10,607 ± 845.04를 달성했으며, D4PG의 9,565.06 ± 209.77를 능가했다.
  • Humanoid-v2 환경에서 SDPG는 약간의 성능 뒷받질(5,093.62 ± 402.25 vs. 6,064.14 ± 192.84)을 보였지만, 추세상 더 긴 훈련 시간 동안 지속적인 향상이 예상되어 최종 성능 향상 잠재력이 있음을 시사한다.
  • BipedalWalker-v2 환경에서 SDPG의 크리틱 네트워크는 목표 수익 분포를 성공적으로 학습했으며, 생성된 분포 히스토ограм과 목표 분포 히스토ограм 간 거의 완벽한 일치가 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.