Skip to main content
QUICK REVIEW

[논문 리뷰] Action-depedent Control Variates for Policy Optimization via Stein's Identity

Hao Liu, Yihao Feng|arXiv (Cornell University)|2017. 10. 30.
Reinforcement Learning in Robotics인용 수 18
한 줄 요약

이 논문은 정책 그래디언트 강화학습에서 분산을 줄이는 데 사용할 수 있는 새로운 기법인 스틴 통제 변수를 제안한다. 이 기법은 스틴의 항등식을 활용하여 행동 및 상태에 따라 변하는 기준 함수를 구성한다. 비선형적이고 더 유연한 기준 함수를 유지하면서도 그래디언트 추정의 비편향성을 유지함으로써, 여러 연속 제어 환경에서 표본 효율성이 크게 향상되며, 가치 함수 기반 기법과 Q-prop를 모두 능가한다. 이는 PPO 및 TRPO 설정에서 성능을 개선한다.

ABSTRACT

Policy gradient methods have achieved remarkable successes in solving challenging reinforcement learning problems. However, it still often suffers from the large variance issue on policy gradient estimation, which leads to poor sample efficiency during training. In this work, we propose a control variate method to effectively reduce variance for policy gradient methods. Motivated by the Stein's identity, our method extends the previous control variate methods used in REINFORCE and advantage actor-critic by introducing more general action-dependent baseline functions. Empirical studies show that our method significantly improves the sample efficiency of the state-of-the-art policy gradient approaches.

연구 동기 및 목표

  • 딥 강화학습에서 표본 효율성을 저해하는 정책 그래디언트 추정의 높은 분산 문제를 해결하기 위함이다.
  • 정책 분포 하에서 분석적 기대값이 0인 일반적인 프레임워크를 개발하여 행동 및 상태에 따라 변하는 통제 변수를 구성하기 위함이다.
  • REINFORCE, A2C, Q-prop와 같은 기존의 통제 변수 기법을 확장하여 더 표현력이 뛰어나고 비선형적인 기준 함수를 가능하게 하기 위함이다.
  • 분산 감소를 통해 최신 정책 최적화 알고리즘인 PPO와 TRPO의 표본 효율성을 향상시키기 위함이다.
  • 스티븐의 항등식을 활용한 이론적으로 탄탄한 방법을 제공하여 이전의 접근 방식을 일반화하면서도 비편향 그래디언트 추정을 유지하기 위함이다.

제안 방법

  • 정책 분포 하에서 기대값이 0인 광범위한 함수의 집합을 도출하기 위해 스틴의 항등식을 활용한다. 이를 통해 유효한 통제 변수를 구성할 수 있다.
  • 이전 방법들이 선형 또는 상태에만 의존하는 것과 달리, 행동 및 상태에 따라 변하는 기준 함수를 구성한다.
  • 재파라미터화 기법과 스틴의 항등식을 결합하여, 미분 가능하고 확장 가능한 그래디언트 추정을 가능하게 한다.
  • 상태와 행동에 모두 의존하는 임의의 기준 함수를 허용하는 일반적인 통제 변수 형태를 유도한다.
  • 분산을 최소화하기 위해 MinVar 및 FitQ와 같은 최적화 목표를 활용하여 기준 함수의 매개수를 학습한다.
  • 비편향성 유지 조건을 만족시키며, PPO 및 TRPO와 같은 정책 최적화 알고리즘에 스틴 통제 변수를 통합한다.

실험 결과

연구 질문

  • RQ1기존 기법들을 초월하여 더 민첩하고 행동 및 상태에 따라 변하는 통제 변수를 구성할 수 있는가?
  • RQ2스티븐의 항등식을 활용하면 Q-prop나 A2C와 같은 이전 기법들보다 더 넓은 범위의 유효한 통제 변수 집합을 도출할 수 있는가?
  • RQ3스티븐 통제 변수는 오프-폴리시 데이터에 의존하지 않고도 표본 효율성을 향상시킬 수 있는가?
  • RQ4MLP, 이차형, 선형 등의 다양한 기준 함수 형태가 스틴 통제 변수와 함께 사용되었을 때 성능에 어떤 영향을 미치는가?
  • RQ5이 방법은 다양한 연속 제어 환경에서 표준 가치 함수 기반 기준 함수와 Q-prop를 일관되게 능가할 수 있는가?

주요 결과

  • 스티븐 통제 변수는 여러 환경에서 그래디언트 분산을 크게 줄여주며, PPO 및 TRPO 모두에서 표본 효율성을 향상시킨다.
  • Humanoid-v1 및 HumanoidStandup-v1 환경에서, MinVar+MLP 기준 함수를 사용한 PPO는 평균 수익 3847 ± 249.3을 기록했으며, 동일한 설정에서 가치 함수 기준 함수(128765 ± 13440)를 초월했다.
  • Hopper-v1 및 Walker2d-v1 환경에서, FitQ+Linear 및 MinVar+Linear를 포함한 모든 스틴 통제 변수 변형이 오프-폴리시 데이터를 사용하지 않음에도 불구하고 Q-prop를 능가했다.
  • 이차형 기준 함수는 정책 학습에서 예상보다 성능이 떨어졌는데, 이는 MLP 및 선형 기준 함수에 비해 수렴 속도가 느리기 때문일 가능성이 높다.
  • MinVar+MLP는 다른 설정들보다 일관되게 뛰어난 성능을 보였으며, 이는 이 방법의 강력한 기본 설정임을 시사한다.
  • 이 방법은 환경 간에 잘 일반화되며, HalfCheetah-v1, Ant-v1 등 다양한 환경에서 기존의 PPO에 비해 가치 함수 기준 함수를 사용한 경우보다 일관되게 향상된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.