Skip to main content
QUICK REVIEW

[논문 리뷰] Marginal Policy Gradients: A Unified Family of Estimators for Bounded Action Spaces with Applications

Carson Eisenach, Haichuan Yang|arXiv (Cornell University)|2018. 06. 13.
Reinforcement Learning in Robotics참고 문헌 30인용 수 5
한 줄 요약

이 논문은 유한한 행동 공간에서 방향 제어를 위한 분산 감소 정책 그래디언트 추정기인 각도 정책 그래디언트(angular policy gradient, APG)를 소개한다. 특히 실시간 전략 게임에서 행동이 단위 벡터인 경우에 특히 관련성이 높다. APG는 통합된 경계 정책 그래디언트(marginal policy gradient, MPG) 가족의 일부로, 정책을 단위 구면 위에 모델링하고 변환 T(a) = a/||a||를 적용함으로써 그래디언트 분산을 감소시켜 표준 정책 그래디언트보다 주행 및 1v1 '킹 오브 글로리' 게임에서 뛰어난 성능을 발휘한다.

ABSTRACT

Many complex domains, such as robotics control and real-time strategy (RTS) games, require an agent to learn a continuous control. In the former, an agent learns a policy over $\mathbb{R}^d$ and in the latter, over a discrete set of actions each of which is parametrized by a continuous parameter. Such problems are naturally solved using policy based reinforcement learning (RL) methods, but unfortunately these often suffer from high variance leading to instability and slow convergence. Unnecessary variance is introduced whenever policies over bounded action spaces are modeled using distributions with unbounded support by applying a transformation $T$ to the sampled action before execution in the environment. Recently, the variance reduced clipped action policy gradient (CAPG) was introduced for actions in bounded intervals, but to date no variance reduced methods exist when the action is a direction, something often seen in RTS games. To this end we introduce the angular policy gradient (APG), a stochastic policy gradient method for directional control. With the marginal policy gradients family of estimators we present a unified analysis of the variance reduction properties of APG and CAPG; our results provide a stronger guarantee than existing analyses for CAPG. Experimental results on a popular RTS game and a navigation task show that the APG estimator offers a substantial improvement over the standard policy gradient.

연구 동기 및 목표

  • 실시간 전략(RTS) 게임과 같이 행동이 유한한 공간에 제약을 받는 경우 정책 그래디언트 방법의 높은 분산 문제를 해결한다. 예를 들어, 단위 구면 상의 행동 제약 조건을 포함한다.
  • 구간으로 제한된 행동과 방향성 행동 모두에 적용 가능한 분산 감소 정책 그래디언트 추정의 통합 프레임워크를 개발한다.
  • 기존의 잘라낸 행동 정책 그래디언트(Clip Action Policy Gradient, CAPG)에 대한 분석을 확장하여, 경계 정책 그래디언트(MPG) 가족에 대한 분산 감소 이론적 보장을 제공한다.
  • 복잡한 환경에서 방향성 행동 공간을 가진 경우 APG의 유효성을 입증한다. 이는 MOBA 게임과 주행 작업을 포함한다.
  • 행동이 구면 상의 연속적 매개변수로 정의되는 매개변수화된 행동 공간에서 안정적이고 샘플 효율적인 학습을 가능하게 한다.

제안 방법

  • 정책을 변환된 행동 공간 위에 모델링하는 결정론적 변환 T를 통해 정책 그래디언트 추정기의 통합 클래스인 경계 정책 그래디언트(MPG) 가족을 제안한다. 이는 CAPG와 APG를 일반화한다.
  • 행동이 단위 벡터(예: 이동 또는 공격 방향)인 방향 제어를 위한 각도 정책 그래디언트(APG) 추정기를 설계하며, 정책을 단위 구면 위에 모델링하기 위해 바흐-미제 분포를 사용한다.
  • 비제한된 행동을 단위 구면으로 매핑하기 위해 변환 T(a) = a/||a||를 적용함으로써, 효과적인 행동가 항상 유한하고 환경의 요구사항과 일치하도록 보장한다.
  • T에 따른 행동의 경계 분포를 활용하여 편향이 없고 분산이 감소한 정책 그래디언트 추정기를 유도함으로써, 높은 분산 환경에서도 안정적인 학습을 가능하게 한다.
  • APG를 A3C, TRPO, PPO와 같은 표준 딥 강화학습 프레임워크와 통합하여, 가치 함수 근사 및 일반화된 이득 추정과의 호환성을 확보한다.
  • 보상 형상화를 위해 선형 잠재 함수를 사용하며, 특징은 게임 상태(예: 캐릭터 체력, 크리스탈 체력 등)에서 유도하여 책임 할당과 학습 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1구간으로 제한된 행동과 방향성(구면) 행동을 모두 다룰 수 있는 분산 감소 정책 그래디언트 추정기의 통합 가족을 구성할 수 있는가?
  • RQ2각도 정책 그래디언트(APG)는 방향 제어 작업에서 표준 정책 그래디언트와 비교해 수렴 속도와 최종 성능 측면에서 어떻게 다른가?
  • RQ3행동 변환을 포함한 환경에서, 경계 정책 그래디언트 프레임워크는 표준 정책 그래디언트 방법에 비해 그래디언트 분산을 얼마나 감소시키는가?
  • RQ4MPG 프레임워크는 기존의 방법들인 CAPG보다 더 강력한 이론적 분산 감소 보장을 제공하는가?
  • RQ5APG는 MOBA 게임과 연속 제어 작업과 같은 복잡하고 고차원적인 환경에서 뛰어난 샘플 효율성과 안정성을 달성할 수 있는가?

주요 결과

  • 플랫폼2D-v1 주행 작업에서 각도 정책 그래디언트(APG) 추정기는 표준 정책 그래디언트보다 훨씬 더 빠른 수렴 속도와 더 높은 최종 누적 할인 보상 성능을 달성한다.
  • 킹 오브 글로리 1v1 MOBA 게임에서 APG 에이전트는 표준 정책 그래디언트 기반 베이스라인에 비해 훨씬 높은 승률과 누적 보상을 기록했다.
  • 초기화 단계와 수렴 단계에서 경계 정책 그래디언트 추정기의 분산은 표준 정책 그래디언트 추정기의 약 절반 수준이었으며, 이는 이론적 분산 감소 주장의 타당성을 검증한다.
  • 값 함수 추정이 정확하지 않은 초기 학습 단계에서도 APG 추정기는 표준 방법보다 낮은 분산을 유지하여 비평가 오차에 대한 강건성을 입증한다.
  • 표준 가우시안 정책에 정규화를 적용할 경우 고분산과 편향이 발생하는 주기적인 행동 공간, 예를 들어 방향 이동과 같은 상황에서 APG는 효과적으로 대응할 수 있었다.
  • 이론적 분석을 통해 APG와 CAPG는 모두 경계 정책 그래디언트 가족의 특수한 경우임을 확인하였으며, 이는 이전 분석보다 더 강력한 분산 감소 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.