Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneous Perturbation Algorithms for Batch Off-Policy Search

Raphaël Fonteneau, L. A. Prashanth|arXiv (Cornell University)|2014. 03. 18.
Reinforcement Learning in Robotics참고 문헌 14인용 수 3
한 줄 요약

이 논문은 연속적인 상태 및 행동 공간에서 배치(off-policy) 강화학습을 위해, 비용-도달 비용 함수의 기울기와 헤시안을 추정하기 위해 동시에 섭동 확률적 근사(SPSA) 및 매끄러운 기능(SF) 방법을 사용하는 새로운 배치 오프-폴리시 강화학습 알고리즘을 제안한다. 이 방법은 기능 근사기법 없이 비모형화된 비모수적 정책 평가기(MFMC)와 일阶 및 이阶 최적화를 조합하여, 기능 근사기법 없이 최적의 정책으로 수렴함을 보여주며, 1차원 연속 제어 문제에서 검증되었다.

ABSTRACT

We propose novel policy search algorithms in the context of off-policy, batch mode reinforcement learning (RL) with continuous state and action spaces. Given a batch collection of trajectories, we perform off-line policy evaluation using an algorithm similar to that by [Fonteneau et al., 2010]. Using this Monte-Carlo like policy evaluator, we perform policy search in a class of parameterized policies. We propose both first order policy gradient and second order policy Newton algorithms. All our algorithms incorporate simultaneous perturbation estimates for the gradient as well as the Hessian of the cost-to-go vector, since the latter is unknown and only biased estimates are available. We demonstrate their practicality on a simple 1-dimensional continuous state space problem.

연구 동기 및 목표

  • 기능 근사기법 없이 연속 상태 및 행동 공간에서 오프-폴리시 배치 모드 강화학습의 과제를 해결한다.
  • 정확한 비용-도달 비용 추정을 위해 몬테카를로 유사 정책 평가를 활용하는 정책 탐색 알고리즘을 개발한다.
  • 닫힌 형태의 표현이 없을 경우, 동시에 섭동을 이용해 기울기와 헤시안을 추정하는 일阶 및 이阶 최적화 방법을 도입한다.
  • 편향이 있는 MFMC 추정치 하에서 정책 파라미터가 근사 최적 해로 수렴하도록 보장한다.
  • 이론적 수렴 보장을 제공하면서도 실용성을 입증하기 위해 1차원 연속 제어 문제에서의 성능을 시험한다.

제안 방법

  • 배치의 트레이젝터리와 상태 및 행동 공간에 대한 지표를 사용하여 비용-도달 비용을 추정하는 비모형화된 정책 평가 방법(MFMC)을 제안한다.
  • 비용-도달 비용 함수의 기울기와 헤시안을 추정하기 위해 동시에 섭동 확률적 근사(SPSA) 및 매끄러운 기능(SF) 기법을 사용한다.
  • SPSA 또는 SF 기울기 추정치를 사용하여 정책 파라미터를 갱신하는 일계 정책 기울기 알고리즘(MCPG-SPSA, MCPG-SF)을 설계한다.
  • 헤시안 추정치를 포함하여 더 빠른 수렴을 보장하는 이계 뉴턴 유사 알고리즘(MCPN-SPSA, MCPN-SF)을 개발한다.
  • 정책 파라미터가 타당한 집합 내에 유지되도록 투영 기반 갱신을 적용한다.
  • 미세한 가정 하에, 특히 MFMC 추정치의 편향이 유계일 경우, 알고리즘이 점점 안정적인 평형점 집합으로 거의 확실히 수렴함을 증명한다.

실험 결과

연구 질문

  • RQ1알 수 없는 동역학을 가진 오프-폴리시 배치 RL에서 동시에 섭동 방법을 사용해 기울기와 헤시안을 효과적으로 추정할 수 있는가?
  • RQ2기능 근사기법 없이 연속 상태 및 행동 공간에서 정책 평가는 어떻게 수행할 수 있는가?
  • RQ3편향이 있는 MFMC 추정치 하에서 일계 및 이계 SPSA/SF 기반 정책 탐색 알고리즘이 최적의 정책으로 수렴하는가?
  • RQ4무한 시간 할인 MDP 설정에서 이러한 알고리즘의 이론적 수렴 행동은 어떠한가?
  • RQ5제시된 방법은 가치 함수 근사기법에 의존하지 않고도 연속 제어 문제에서 실용적인 성능을 달성할 수 있는가?

주요 결과

  • 제안된 MCPG-SPSA 및 MCPG-SF 알고리즘은 MFMC 추정기의 편향이 유계일 경우, 확률 1 − η로 점점 안정적인 평형점 집합으로 수렴한다.
  • MCPN-SPSA 및 MCPN-SF 알고리즘은 뉴턴 갱신 미분방정식의 점점 안정적인 평형점 집합으로 확률 1 − η로 수렴한다.
  • SPSA 기반 알고리즘에서의 헤시안 추정치는 δ → 0일 때 거의 확실히 진짜 헤시안으로 수렴한다.
  • 기울기 및 헤시안 추정기는 한계에서 일致함을 입증하였으며, 편향은 점차 사라진다.
  • 이 방법은 1차원 연속 제어 문제에서 실용적인 성능을 달성하여, 기능 근사기법 없이도 실현 가능함을 입증한다.
  • 비용-도달 비용 함수가 стрict한 리아푸노프 함수로 기능하는 ODE 기반 분석을 통해 이론적 수렴이 확립되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.