Skip to main content
QUICK REVIEW

[논문 리뷰] Zeroth-order Deterministic Policy Gradient

Harshat Kumar, Dionysios S. Kalogerias|arXiv (Cornell University)|2020. 06. 12.
Reinforcement Learning in Robotics참고 문헌 36인용 수 5
한 줄 요약

이 논문은 Q함수의 두점 제로차수 쿼리에 의해 저차원 행동공간의 펌더베이션을 통해 정책 그래เดียน트를 추정하는 모델-프리 강화학습 알고리즘인 제로차수 결정적 정책 그래디언트(ZDPG)를 제안한다. 이는 비평가(critic)가 필요 없도록 한다. ZDPG는 증명 가능한 알고리즘 안정성을 확보하고, 유한 샘플 복잡도를 최대 두 계단 정도 향상시켜, 시스템 노이즈가 존재하는 탐색 작업에서 표준 PG와 베이스라인 PG보다 뛰어난 성능을 발휘한다.

ABSTRACT

Deterministic Policy Gradient (DPG) removes a level of randomness from standard randomized-action Policy Gradient (PG), and demonstrates substantial empirical success for tackling complex dynamic problems involving Markov decision processes. At the same time, though, DPG loses its ability to learn in a model-free (i.e., actor-only) fashion, frequently necessitating the use of critics in order to obtain consistent estimates of the associated policy-reward gradient. In this work, we introduce Zeroth-order Deterministic Policy Gradient (ZDPG), which approximates policy-reward gradients via two-point stochastic evaluations of the $Q$-function, constructed by properly designed low-dimensional action-space perturbations. Exploiting the idea of random horizon rollouts for obtaining unbiased estimates of the $Q$-function, ZDPG lifts the dependence on critics and restores true model-free policy learning, while enjoying built-in and provable algorithmic stability. Additionally, we present new finite sample complexity bounds for ZDPG, which improve upon existing results by up to two orders of magnitude. Our findings are supported by several numerical experiments, which showcase the effectiveness of ZDPG in a practical setting, and its advantages over both PG and Baseline PG.

연구 동기 및 목표

  • 비평가에 의존하지 않고 진정한 모델-프리 정책 학습을 복원하기 위해 결정적 정책 그래디언트 방법에서 비평가를 제거하는 것.
  • 증명 가능한 안정성과 제로차수 그래디언트 추정 프레임워크를 통해 표준 정책 그래디언트 방법의 불안정성과 높은 분산 문제를 해결하는 것.
  • 고차원 펌더베이션과 비평가 편향에 대한 의존도를 줄임으로써 강화학습에서의 유한 샘플 수렴 속도를 향상시키는 것.
  • 펌더베이션을 저차원 행동공간에서 수행함으로써 고차원 정책 공간에서 효율적이고 확장 가능한 정책 최적화를 가능하게 하는 것.
  • 최소한의 몬테카를로 분산 감소 기법을 사용하는 실용적 환경에서의 노이즈에 강건하고 표준 PG 및 베이스라인 PG 방법보다 뛰어난 성능을 입증하는 것.

제안 방법

  • ZDPG는 초기 행동 주변의 저차원 행동공간 펌더베이션에서 Q함수의 스토케스틱 평가를 통해 두점 제로차수 정책-보상 그래디언트 추정을 구성한다.
  • 무작위 수명 롤아웃을 활용하여 비편향이면서 노이즈 있는 Q함수 추정을 확보함으로써 비평가 기반 그래디언트 근사화를 가능하게 한다.
  • 행동 펌더베이션을 통한 스무스한 대체 목표함수를 도입하여 히وري스틱 기반 백그라운드 기법 없이도 준그래디언트 분산 안정성을 보장한다.
  • 각 에피소드당 단일 또는 두 점의 Q평가를 사용하며, 업데이트당 오직 두 번의 시스템 롤아웃만 필요로 하여 계산 오버헤드를 크게 줄인다.
  • 펌더베이션 크기를 조절하는 스무스닝 파라미터 μ를 사용하여 그래디언트 근사의 정확도와 분산 간 균형을 이룬다.
  • 표준 정규성 조건(Lipschitz Q함수, 헤시안-Lipschitz) 하에서의 유한 샘플 수렴 분석을 수행하여 이전의 제로차수 방법보다 향상된 복잡도 한계를 도출한다.

실험 결과

연구 질문

  • RQ1결정적 정책 그래디언트 방법이 비평가에 의존하지 않고 진정한 모델-프리 학습을 달성할 수 있는가?
  • RQ2고차원 정책 공간에서 제로차수 그래디언트 추정을 효율적이고 안정적으로 수행하면서 펌더베이션 차원을 최소화할 수 있는가?
  • RQ3표준 정규성 가정 하에서 제로차수 결정적 정책 그래디언트 방법의 유한 샘플 수렴 속도는 어떠한가?
  • RQ4시스템 노이즈 하에서 ZDPG는 표준 PG 및 베이스라인 PG 방법에 비해 샘플 효율성과 강건성 측면에서 어떻게 비교되는가?
  • RQ5비평가 기반 가치함수 근사 없이도 제로차수 방법이 연속 제어 작업에서 증명 가능한 안정성과 향상된 수렴 속도를 달성할 수 있는가?

주요 결과

  • ZDPG는 Grad-Lipschitz 및 Hessian-Lipschitz Q함수 가정 하에서 기존 제로차수 방법 대비 최대 두 계단의 향상된 유한 샘플 복잡도 한계를 확보한다.
  • 시스템 노이즈 ω = 0.1이 존재하는 탐색 작업에서 ZDPG-S는 Monte Carlo 분산 감소를 적용하지 않은 경우(N=1)에도 PG-B를 일관되게 능가하며, 노이즈에 대한 강건성을 입증한다.
  • ZDPG-S는 장기 평가 수명(T=100) 동안 안정된 학습 곡선을 유지하는 반면, PG-B는 장기간의 최적해 이탈 및 목표에 도달하지 못하는 불안정성을 보인다.
  • PG-B가 기반가치함수를 추정하기 위해 다수의 롤아웃 추정을 사용하더라도 여전히 ZDPG-S에 뒤지며, ZDPG-S는 각 에피소드당 오직 두 번의 롤아웃만 필요로 하므로 효율성과 강건성의 우월성을 입증한다.
  • ZDPG에서 무작위 정책 제거로 인해 다양한 노이즈 수준과 롤아웃 길이에서 더 빠르고 일관된 수렴이 이루어지며, 학습 곡선을 통해 확인된다.
  • 제안된 방법은 히وري스틱 기반 백그라운드 기법과 대비하여 비히어스틱이고 결정적인 정책 기반 그래디언트 추정을 통해 증명 가능한 분산 안정성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.