Skip to main content
QUICK REVIEW

[논문 리뷰] A Regularized Approach to Sparse Optimal Policy in Reinforcement Learning

Xiang Li, Wenhao Yang|arXiv (Cornell University)|2019. 03. 02.
Reinforcement Learning in Robotics참고 문헌 40인용 수 9
한 줄 요약

이 논문은 강화학습에서 희소성과 다중모달 정책을 유도하기 위해 엔트로피 정규화를 확장한 일반적인 정규화된 마르코프 결정과정(MDP) 프레임워크를 제안한다. 민감한 정규화 항을 도입함으로써 정책의 희소성 제어가 가능해지고 고차원 행동 공간에서 성능 향상이 이루어지며, 이는 오프정책 액터-크리틱 알고리즘을 사용한 실험적 검증을 통해 이산 및 연속 환경 전반에서 뛰어난 안정성과 희소성 제어 성능을 입증한다.

ABSTRACT

We propose and study a general framework for regularized Markov decision processes (MDPs) where the goal is to find an optimal policy that maximizes the expected discounted total reward plus a policy regularization term. The extant entropy-regularized MDPs can be cast into our framework. Moreover, under our framework, many regularization terms can bring multi-modality and sparsity, which are potentially useful in reinforcement learning. In particular, we present sufficient and necessary conditions that induce a sparse optimal policy. We also conduct a full mathematical analysis of the proposed regularized MDPs, including the optimality condition, performance error, and sparseness control. We provide a generic method to devise regularization forms and propose off-policy actor critic algorithms in complex environment settings. We empirically analyze the numerical properties of optimal policies and compare the performance of different sparse regularization forms in discrete and continuous environments.

연구 동기 및 목표

  • 기존 엔트로피 정규화를 초월해 희소성과 다중모달 최적 정책을 지원하는 일반적인 정규화된 MDP 프레임워크를 개발하는 것.
  • 정규화가 최적 정책의 희소성 유도에 필요한 충분조건과 필수조건을 규명하는 것.
  • 정규화에 의해 유도되는 성능 오차를 분석하고 연속 행동 공간에서의 정규화 선택을 안내하는 것.
  • 복잡한 환경에서 다양한 정규화 형태와 호환되는 오프정책 액터-크리틱 알고리즘을 설계하는 것.

제안 방법

  • 정책에 대한 정규화 항을 더한 기대 할할 보상 최대화를 목표로 하는 일반적인 정규화된 MDP 프레임워크를 수립한다.
  • 볼록 해석학과 일반화된 벨만 방정식을 사용해 정규화된 MDP의 최적성 조건을 유도한다.
  • 희소성을 유도할 수 있는 정규화 형태를 구성하는 일반적인 방법을 제안하며, 이는 히틀러 엔트로피와 새로운 형태인 Exp(x) 및 Cos(x)를 포함한다.
  • 연속 제어를 위해 재파arameterization 기법을 사용하고 학습 안정성을 확보하기 위해 경험 재현 기법을 적용한 오프정책 액터-크리틱 알고리즘을 개발한다.
  • 정규화 항을 정책 손실 함수를 통해 통합하는 기반에 기반한 기울기 기반 정책 업데이트 규칙을 사용한다.
  • 초파rameter 튜닝과 아블레이션 연구를 통해 다양한 환경에서 민감도와 성능을 평가한다.

실험 결과

연구 질문

  • RQ1어떤 정규화 형태가 MDP에서 최적 정책의 희소성을 유도할 수 있으며, 이러한 희소성에 필요한 충분조건과 필수조건은 무엇인가?
  • RQ2정규화 계수 λ가 학습된 정책의 희소성과 성능에 어떤 영향을 미치는가?
  • RQ3제안된 프레임워크는 연속 제어 작업에서 표준 엔트로피 정규화보다 성능 오차를 줄일 수 있는가?
  • RQ4이산 및 연속 환경 전반에서 다양한 정규화 형태는 수렴 속도, 안정성 및 최종 성능 측면에서 어떻게 비교되는가?
  • RQ5이 프레임워크는 샘플 효율성 또는 안전성을 희생시키지 않고 다중모달 행동을 얼마나 잘 지원할 수 있는가?

주요 결과

  • 제안된 프레임워크는 엔트로피 정규화된 강화학습을 일반화하며, 히틀러 엔트로피를 특수 케이스로 포함하여 엔트로피 지수를 통해 희소성을 가능하게 한다.
  • 히틀러, Exp(x), Cos(x) 정규화 형태는 희소성을 유도하며, 정규화 계수 λ를 통해 희소성 정도를 제어할 수 있다.
  • 히틀러와 Exp(x) 정규화는 샤논 엔트로피보다 낮은 성능 오차를 보이며, 정규화된 최적 가치가 진짜 최적 가치에 더 가까워진다.
  • MuJoCo와 같은 연속 제어 작업에서 히틀러와 Exp(x) 정규화는 샤논 엔트로피보다 λ에 대해 덜 민감하며, 고 λ 값에서 수렴하지 못하는 문제를 피한다.
  • Atari와 MuJoCo 환경에서의 실험 결과로, 히틀러와 Exp(x)와 같은 희소 정규화 기법은 표준 엔트로피 정규화보다 안정적인 학습과 뛰어난 샘플 효율성을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.