Skip to main content
QUICK REVIEW

[논문 리뷰] Actor-critic versus direct policy search: a comparison based on sample complexity

Arnaud de Froissard de Broissia, Olivier Sigaud|arXiv (Cornell University)|2016. 06. 29.
Reinforcement Learning in Robotics참고 문헌 20인용 수 9
한 줄 요약

이 논문은 연속적인 마운틴카 벤치마크에서 딥 디터미니스틱 포olic 그레디언트(DDPG) — 액터-크리틱 딥 강화학습 알고리즘 — 와 공분산 행렬 적응 진화 전략(CMA-ES) — 직접 정책 탐색 방법 — 의 샘플 효율성을 비교한다. DDPG는 재현 버퍼와 기울기 기반 최적화를 사용함으로써 수렴하기 위해 훨씬 적은 환경 상호작용을 요구하며, 이로 인해 CMA-ES의 확률적이고 기울기 없는 탐색에도 불구하고 상당히 뛰어난 샘플 효율성을 보여준다. CMA-ES는 보상 가중치 메커니즘을 갖추고 있음에도 말이다.

ABSTRACT

Sample efficiency is a critical property when optimizing policy parameters for the controller of a robot. In this paper, we evaluate two state-of-the-art policy optimization algorithms. One is a recent deep reinforcement learning method based on an actor-critic algorithm, Deep Deterministic Policy Gradient (DDPG), that has been shown to perform well on various control benchmarks. The other one is a direct policy search method, Covariance Matrix Adaptation Evolution Strategy (CMA-ES), a black-box optimization method that is widely used for robot learning. The algorithms are evaluated on a continuous version of the mountain car benchmark problem, so as to compare their sample complexity. From a preliminary analysis, we expect DDPG to be more sample efficient than CMA-ES, which is confirmed by our experimental results.

연구 동기 및 목표

  • 최신 정책 최적화 알고리즘의 연속 제어 작업에서의 샘플 효율성을 평가하고 비교하는 것.
  • 액터-크리틱 방법인 DDPG가 CMA-ES와 같은 직접 정책 탐색 방법보다 더 샘플 효율적인가를 조사하는 것.
  • 통제된 벤치마크 환경에서 DDPG와 CMA-ES 간의 샘플 효율성 차이를 이끌어내는 핵심 요소들을 분리하여 분석하는 것.
  • 로봇 학습 맥락에서 딥 강화학습과 블랙박스 최적화의 상대적 성능에 대한 경험적 증거를 제공하는 것.

제안 방법

  • 연구는 정책 최적화를 위한 벤치마크 환경으로 연속적인 마운틴카 문제를 사용한다.
  • DDPG는 액터(정책)와 크리틱(가치 함수) 모두에 딥 신경망을 사용하며, 경험 전이를 저장하고 재사용하기 위해 재현 버퍼를 활용한다.
  • DDPG는 타겟 네트워크와 배치 정규화를 구현하여 학습을 안정화시키며, 오프-폴리시 업데이트를 사용하는 시간 차분 학습을 활용한다.
  • CMA-ES는 다변량 정규분포를 사용하여 정책 파라미터를 성능 기반으로 샘플링하고 업데이트함으로써 확률적이고 기울기 없는 최적화를 통해 직접 정책 탐색을 수행한다.
  • 두 알고리즘은 공정한 비교를 위해 동일한 280개 파라미터를 가진 신경망 정책 표현을 사용한다.
  • 실험은 성능 기준에 도달하기 위해 필요한 환경 상호작용 수를 측정하며, 결과는 다수의 실행 평균을 통해 산출된다.

실험 결과

연구 질문

  • RQ1DDPG는 연속 제어 작업에서 CMA-ES보다 더 샘플 효율적인가?
  • RQ2DDPG가 CMA-ES보다 뛰어난 샘플 효율성을 보이는 데 기여하는 특정 알고리즘 구성 요소는 무엇인가?
  • RQ3재현 버퍼와 기울기 기반 최적화는 확률적이고 기울기 없는 탐색에 비해 자료 재사용과 수렴 속도 측면에서 어떻게 비교되는가?
  • RQ4액터-크리틱 방법에서 가치 함수 근사가 수렴에 필요한 환경 상호작용 수를 줄이는 데 기여하는가?

주요 결과

  • DDPG는 연속 마운틴카 벤치마크에서 CMA-ES보다 훨씬 적은 환경 상호작용으로 수렴을 달성하여 뛰어난 샘플 효율성을 보여주었다.
  • DDPG의 재현 버퍼 사용은 수집된 경험을 효과적으로 재사용할 수 있게 하여 추가적인 환경 상호작용 없이도 정책 업데이트를 가능하게 하였다.
  • DDPG는 CMA-ES에 비해 실행 간 변동성이 낮아 더 안정적이고 예측 가능한 학습 동역학을 보였다.
  • CMA-ES의 근사 자연 기울기 하강법에도 불구하고, DDPG에서 사용하는 분석적 기울기 하강법이 더 효과적이었다.
  • DDPG의 크리틱은 궤적 재평가 없이도 정책 개선을 가능하게 하여 새로운 환경 샘플에 대한 의존도를 감소시켰다.
  • 결과는 액터-크리틱 방법인 DDPG가 직접 정책 탐색보다 샘플 제약 조건이 있는 로봇 학습 시나리오에 더 적합하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.