Skip to main content
QUICK REVIEW

[논문 리뷰] Expected Policy Gradients for Reinforcement Learning

Kamil Ciosek, Shimon Whiteson|arXiv (Cornell University)|2018. 01. 10.
Reinforcement Learning in Robotics참고 문헌 56인용 수 21
한 줄 요약

이 논문은 기대 정책 기울기(Expected Policy Gradients, EPG)를 소개한다. EPG는 기울기 추정 과정에서 행동에 대해 통합함으로써 확률적 및 결정적 정책 기울기 방법을 일반화하는 통합된 프레임워크이다. EPG는 결정적 정책에 의존하지 않으면서도 기울기 분산을 감소시키며, 연속 제어 벤치마크에서 최신 기술 성능을 달성하고, 기존 접근법을 포함하는 일반 정책 기울기 정리(theorem)를 제공한다.

ABSTRACT

We propose expected policy gradients (EPG), which unify stochastic policy gradients (SPG) and deterministic policy gradients (DPG) for reinforcement learning. Inspired by expected sarsa, EPG integrates (or sums) across actions when estimating the gradient, instead of relying only on the action in the sampled trajectory. For continuous action spaces, we first derive a practical result for Gaussian policies and quadratic critics and then extend it to a universal analytical method, covering a broad class of actors and critics, including Gaussian, exponential families, and policies with bounded support. For Gaussian policies, we introduce an exploration method that uses covariance proportional to the matrix exponential of the scaled Hessian of the critic with respect to the actions. For discrete action spaces, we derive a variant of EPG based on softmax policies. We also establish a new general policy gradient theorem, of which the stochastic and deterministic policy gradient theorems are special cases. Furthermore, we prove that EPG reduces the variance of the gradient estimates without requiring deterministic policies and with little computational overhead. Finally, we provide an extensive experimental evaluation of EPG and show that it outperforms existing approaches on multiple challenging control domains.

연구 동기 및 목표

  • 확률적 및 결정적 정책 기울기 방법을 하나의 일반적 프레임워크로 통합하기 위해.
  • 결정적 정책에 의존하지 않고 정책 학습에서 기울기 분산을 감소시키기 위해.
  • 다양한 정책 및 크리틱 아키텍처에 적용 가능한 일반적인 분석적 기법을 개발하기 위해.
  • 새로운 일반 정책 기울기 정리로 이론적 기반을 제공하기 위해.
  • 어려운 제어 환경에서 EPG의 우수성을 경험적으로 검증하기 위해.

제안 방법

  • EPG는 단일로 샘플된 행동에 의존하는 대신, 크리틱의 행동에 대한 기울기를 행동에 대해 통합함으로써 모든 행동에 대한 기대 기울기를 계산한다.
  • 가우시안 정책과 이차형 크리틱의 경우, EPG는 크리틱의 스케일링된 헤시안 행렬의 행렬 지수를 사용하여 폐형 해를 유도한다.
  • 해석적 통합을 통해 지수족 정책과 유계 지지 정책으로의 확장이 가능하다.
  • 새로운 탐색 전략이 도입되며, 이는 공분산이 크리틱의 헤시안의 행렬 지수에 비례하도록 하여 정보 기반 탐색을 촉진한다.
  • 이산 행동의 경우, EPG는 소프트맥스 정책과 기대값 통합을 사용하여 적응시킨다.
  • 일반 정책 기울기 정리를 유도하여, SPG와 DPG가 EPG의 특수한 경우임을 보여준다.

실험 결과

연구 질문

  • RQ1확률적 및 결정적 정책 기울기 방법을 모두 포함하는 통합된 정책 기울기 프레임워크를 개발할 수 있는가?
  • RQ2결정적 정책에 의존하지 않고도 기대 기울기 추정이 정책 학습에서 분산을 감소시킬 수 있는가?
  • RQ3해석적 통합은 어떤 광범위한 정책 및 크리틱 아키텍처에 적용될 수 있는가?
  • RQ4헤시안 기반의 공분산 스케일링은 탐색과 학습 효율성에 어떤 영향을 미치는가?
  • RQ5EPG는 어려운 연속 제어 작업에서 기존 정책 기울기 방법보다 뛰어나게 성능을 발휘하는가?

주요 결과

  • EPG는 확률적 정책을 사용하더라도 기존 정책 기울기 방법에 비해 기울기 분산을 크게 감소시킨다.
  • MuJoCo 환경을 포함한 여러 연속 제어 벤치마크에서 최신 기술 성능을 달성한다.
  • 가우시안 정책의 경우, 헤시안 기반 탐색 전략이 더 빠른 수렴과 더 나은 샘플 효율성을 이끈다.
  • 이론적 프레임워크는 SPG와 DPG를 하나의 일반 정책 기울기 정리 아래 통합한다.
  • 다양한 환경에서 일관된 향상이 이루어지며, 계산 오버헤드도 낮게 유지된다.
  • 경험적 결과는 EPG가 샘플 효율성과 최종 성능 모두에서 베이스라인 방법을 능가함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.