Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Primal-Dual Reinforcement Learning: Accelerating Actor-Critic using Bellman Duality

Woon Sang Cho, Mengdi Wang|arXiv (Cornell University)|2017. 12. 07.
Reinforcement Learning in Robotics참고 문헌 14인용 수 7
한 줄 요약

이 논문은 벨만 이중성(Bellman duality)을 활용하여 가치 함수와 정책 업데이트를 정규화된 라그랑주 형식을 통해 결합하는 새로운 액터-크리틱 방법인 딥 프라임알-듀얼 강화학습(Deep Primal-Dual Reinforcement Learning)을 제안한다. 이론적 분석과 실험을 통해 이 방법은 이점 함수를 페널티 항으로 포함시켜 학습을 안정화시키며, 표준 one-step TD 액터-크리틱보다 빠른 수렴 속도를 보이며 샘플 복잡도를 감소시킴을 입증한다. 특히 카트폴(cart-pole) 실험에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

We develop a parameterized Primal-Dual $π$ Learning method based on deep neural networks for Markov decision process with large state space and off-policy reinforcement learning. In contrast to the popular Q-learning and actor-critic methods that are based on successive approximations to the nonlinear Bellman equation, our method makes primal-dual updates to the policy and value functions utilizing the fundamental linear Bellman duality. Naive parametrization of the primal-dual $π$ learning method using deep neural networks would encounter two major challenges: (1) each update requires computing a probability distribution over the state space and is intractable; (2) the iterates are unstable since the parameterized Lagrangian function is no longer linear. We address these challenges by proposing a relaxed Lagrangian formulation with a regularization penalty using the advantage function. We show that the dual policy update step in our method is equivalent to the policy gradient update in the actor-critic method in some special case, while the value updates differ substantially. The main advantage of the primal-dual $π$ learning method lies in that the value and policy updates are closely coupled together using the Bellman duality and therefore more informative. Experiments on a simple cart-pole problem show that the algorithm significantly outperforms the one-step temporal-difference actor-critic method, which is the most relevant benchmark method to compare with. We believe that the primal-dual updates to the value and policy functions would expedite the learning process. The proposed methods might open a door to more efficient algorithms and sharper theoretical analysis.

연구 동기 및 목표

  • 함수 근사와 함께 큰 MDP에서 직접적인 딥 프라임알-듀얼 학습의 불안정성과 비가역성 문제를 해결하기 위해.
  • 벨만 이중성을 활용하여 가치 함수와 정책 업데이트 간의 더 강력한 결합을 도모함으로써 학습 효율성을 향상시키기 위해.
  • 이점 함수를 사용한 정규화 페널티를 도입하여 파rameterized 프라임알-듀얼 업데이트의 안정성을 확보하기 위해.
  • 일부 조건 하에서 이중 정책 업데이트가 표준 정책 기울기 업데이트와 동일시됨을 보여주어 실용적인 구현 가능성을 확보하기 위해.
  • 현재 정책의 행동에 기반하여 가치 함수 업데이트를 조건화함으로써 샘플 효율성을 향상시키기 위해.

제안 방법

  • 학습 안정화를 위해 이점 함수의 제곱에 비례하는 정규화 페널티 항을 포함한 완화된 라그랑주 형식을 제안한다.
  • 벨만 이중성을 기반으로 한 프라임알-듀얼 단계를 통해 가치 함수 및 정책 파rameter를 동시에 업데이트하는 최소-최대 최적화 프레임워크를 사용한다.
  • 정규화된 라그랑주 형식의 핵심 구성요소로 이점 함수 $ A_{\theta_v}(s,a) $ 를 활용하여 안정성과 수렴 속도 향상을 도모한다.
  • 정적 분포 하에서 수학적으로 표준 정책 기울기 업데이트와 동일한 정책 업데이트를 유도하며, $ \alpha $ 를 추정할 필요 없이 온라인 학습이 가능하도록 한다.
  • 정규화된 라그랑주 형식에 대해 확률적 경사하강법을 적용하며, 가치 함수 및 정책 네트워크를 온정책 경험을 기반으로 결합하여 업데이트한다.
  • 학습 중에 이점 함수의 편향된 추정치로 one-step 시간 차분 오차 $ \delta_{\theta_v}(s,a) $ 를 사용한다.

실험 결과

연구 질문

  • RQ1벨만 이중성을 기반으로 한 프라임알-듀얼 방법이 큰 상태 공간을 가진 딥 강화학습에 효과적으로 적용될 수 있는가?
  • RQ2딥 RL에서 파rameterized 프라임알-듀얼 업데이트의 비凸성과 불안정성을 어떻게 완화할 수 있는가?
  • RQ3벨만 이중성을 통해 가치 함수와 정책 업데이트를 결합하면 표준 액터-크리틱 방법보다 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ4제안된 방법에서 이중 정책 업데이트는 적절한 조건 하에서 표준 정책 기울기 업데이트와 동일한가?
  • RQ5현재 정책의 행동에 기반하여 가치 함수 업데이트를 조건화하면 샘플 효율성이 향상되는가?

주요 결과

  • 비록 누적 보상의 분산이 약간 높아지긴 하지만, 제안된 방법은 one-step TD 액터-크리틱 기준선 대비 샘플 복잡도를 크게 감소시킴을 확인하였다.
  • 정적 분포를 사용할 경우 이중 형식에서의 정책 기울기 업데이트는 표준 정책 기울기 정리와 수학적으로 동일하며, 이는 이론적 기반의 타당성을 입증한다.
  • 벨만 이중성을 통해 가치 함수와 정책 업데이트가 더 정보가 풍부하고 강하게 결합되어 더 빠른 학습 동역학을 유도한다.
  • 이점 함수를 활용한 정규화가 학습을 안정화시키고 파arameterized 프라임알-듀얼 업데이트의 발산을 방지한다.
  • 카트폴 환경에서의 실험 결과, 제안된 알고리즘이 기준선 액터-크리틱 방법보다 더 빠르게 수렴하고 더 적은 샘플 수로 학습을 완료함을 입증하였다.
  • 정적 분포 $ \alpha $ 의 직접 추정을 피함으로써, 비용이 많이 드는 계산 없이 온라인, 온정책 학습이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.