Skip to main content
QUICK REVIEW

[논문 리뷰] How to Learn a Useful Critic? Model-based Action-Gradient-Estimator Policy Optimization

Pierluca D’Oro, Wojciech Jaśkowski|arXiv (Cornell University)|2020. 04. 29.
Reinforcement Learning in Robotics참고 문헌 57인용 수 11
한 줄 요약

이 논문은 MAGE를 제안하며, 학습된 동역학 모델을 사용한 시간차 학습을 통해 정확한 행동가치 기울기 예측을 위한 비평가를 명시적으로 훈련시키는 모델 기반 액터-크리틱 강화학습 알고리즘이다. 동역학 모델을 통해 이차 미분을 수행함으로써 MAGE는 MuJoCo 연속 제어 벤치마크에서 최신의 모델-프리 및 모델-기반 기준보다 더 샘플 효율적으로 정책 최적화를 향상시킨다.

ABSTRACT

Deterministic-policy actor-critic algorithms for continuous control improve the actor by plugging its actions into the critic and ascending the action-value gradient, which is obtained by chaining the actor's Jacobian matrix with the gradient of the critic with respect to input actions. However, instead of gradients, the critic is, typically, only trained to accurately predict expected returns, which, on their own, are useless for policy optimization. In this paper, we propose MAGE, a model-based actor-critic algorithm, grounded in the theory of policy gradients, which explicitly learns the action-value gradient. MAGE backpropagates through the learned dynamics to compute gradient targets in temporal difference learning, leading to a critic tailored for policy improvement. On a set of MuJoCo continuous-control tasks, we demonstrate the efficiency of the algorithm in comparison to model-free and model-based state-of-the-art baselines.

연구 동기 및 목표

  • 기존의 비평가가 가치 예측을 최적화하는 데에 치중되어 있어, 결정론적 정책 기울기 방법에 필수적인 행동 기울기 정확도를 최적화하지 못하는 한계를 해결하기 위해.
  • 정책 향상의 정밀한 기울기를 제공하는 비평가를 훈련시킴으로써 연속 제어에서 샘플 효율성을 향상시키기 위해.
  • 수익 예측 외에 정책 최적화에 사용되는 기울기 신호를 직접 최적화하는 모델 기반 방법을 개발하기 위해.
  • 행동 기울기 학습을 명시적으로 수행할 경우 고차원 제어 작업에서 더 나은 정책 성능과 더 빠른 수렴 속도를 달성할 수 있음을 입증하기 위해.

제안 방법

  • MAGE는 학습된 동역학 모델을 사용하여 합성 전이를 생성함으로써, 모델을 통해 역전파를 수행하여 비평가의 타겟 기울기를 계산한다.
  • 비평가는 시간차 학습을 통해 예측된 기울기와 타겟 기울기 간의 오차를 최소화하도록 훈련되며, 타겟 기울기 계산을 위해 이중 역전파를 사용한다.
  • 행동 기울기 타겟은 동역학 모델의 미분 가능성과 함께, TD 타겟을 행동에 대해 미분하여 유도된다.
  • 액터의 야코비안과 비평가의 행동 기울기를 연결하여 정책 기울기를 계산함으로써, 비평가 훈련과 정책 향상 간의 일치를 보장한다.
  • 기울기 타겟의 강건성과 일반화를 향상시키기 위해 동역학 모델의 앙상블을 사용한다.
  • 비평가는 가치 예측 오차와 기울기 예측 오차를 모두 포함하는 손실 함수를 사용하며, 기울기 감독은 모델의 미분 가능한 동역학에서 유도된다.

실험 결과

연구 질문

  • RQ1기대 수익 예측 외에 행동가치 기울기 예측을 명시적으로 훈련시킬 경우, 더 나은 정책 최적화가 이루어지는가?
  • RQ2학습된 동역학 모델을 사용해 기울기 타겟을 생성하면, 모델 기반 강화학습에서 샘플 효율성이 향상되는가?
  • RQ3행동 기울기 학습을 명시적으로 수행하는 것이 표준 가치 예측 훈련 대비 정책 성능과 수렴 속도에서 어떻게 비교되는가?
  • RQ4동역학 모델을 통해 이차 미분을 수행하면, 표준 모델-프리 또는 모델-기반 접근보다 더 효과적인 정책 기울기를 도출할 수 있는가?

주요 결과

  • MAGE는 MuJoCo 연속 제어 환경에서 최신의 모델-프리 및 모델-기반 기준보다 유의미하게 더 높은 샘플 효율성을 달성한다.
  • 비평가의 정확한 행동 기울기 추정 덕분에 알고리즘이 더 빠르게 수렴하고 더 높은 최종 성능을 달성한다.
  • 행동 기울기 예측을 위한 비평가의 명시적 훈련은 가치 예측 전용 훈련보다 더 안정적이고 효과적인 정책 업데이트를 이끈다.
  • 이중 역전파를 통한 모델 기반 기울기 타겟 사용은 근사 동역학 모델을 사용하더라도 우수한 정책 최적화를 가능하게 한다.
  • 이차 기울기로 인한 학습 시간이 두 배로 증가하지만, MAGE의 샘플 효율성 덕분에 상호작용 비용이 높은 환경에서 더 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.