Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging exploration in off-policy algorithms via normalizing flows

Bogdan Mazoure, Thang Doan|arXiv (Cornell University)|2019. 05. 16.
Reinforcement Learning in Robotics참고 문헌 39인용 수 12
한 줄 요약

이 논문은 정규화 흐름을 사용하여 더 풍부하고 다중모드의 정책을 모델링하는 소프트 액터-크리틱(SAC)의 확장인 SAC-NF를 제안한다. 이는 이완정책 강화학습에서 탐색 성능을 크게 향상시킨다. 간단한 노이즈 분포를 역행할 수 있는 변환을 통해 정책을 변형함으로써, SAC-NF는 MuJoCo 및 PyBullet Roboschool 환경에서 표준 SAC보다 최대 94.5% 적은 파라미터를 사용하면서도 뛰어난 성능을 달성한다.

ABSTRACT

The ability to discover approximately optimal policies in domains with sparse rewards is crucial to applying reinforcement learning (RL) in many real-world scenarios. Approaches such as neural density models and continuous exploration (e.g., Go-Explore) have been proposed to maintain the high exploration rate necessary to find high performing and generalizable policies. Soft actor-critic(SAC) is another method for improving exploration that aims to combine efficient learning via off-policy updates while maximizing the policy entropy. In this work, we extend SAC to a richer class of probability distributions (e.g., multimodal) through normalizing flows (NF) and show that this significantly improves performance by accelerating the discovery of good policies while using much smaller policy representations. Our approach, which we call SAC-NF, is a simple, efficient,easy-to-implement modification and improvement to SAC on continuous control baselines such as MuJoCo and PyBullet Roboschool domains. Finally, SAC-NF does this while being significantly parameter efficient, using as few as 5.5% the parameters for an equivalent SAC model.

연구 동기 및 목표

  • 더 풍부하고 다중모드의 정책 표현을 가능하게 하여 이완정책 강화학습에서 탐색 성능을 향상시키는 것.
  • SAC의 단일모드 가우시안 정책의 한계를 해결하여 희박하거나 속임수적인 환경에서 최적의 정책을 발견하는 데 어려움을 겪지 않도록 하는 것.
  • 성능을 유지하거나 향상시키면서도 정책 네트워크의 파라미터 수를 줄여 샘플 효율성과 파라미터 효율성을 높이는 것.
  • 정규화 흐름이 이완정책 RL 환경에서 얼마나 효과적인지 평가하는 것, 특히 복잡한 연속 제어 벤치마크에서의 성능을 분석하는 것.
  • 희박한 보상이 존재하는 고차원 제어 과제에서 더 빠른 수렴과 더 나은 일반화 성능을 달성하는 것.

제안 방법

  • 정책 헤드에 정규화 흐름(NFs)을 통합하여, 역행할 수 있고 미분 가능한 변환을 통해 복잡한 다중모드 행동 분포를 모델링하는 것.
  • 플레인, 레이디얼, IAF 흐름을 사용하여 정책을 매개변수화함으로써 표현력 있는 행동 분포를 확보하면서도 계산 가능한 가능도를 유지하는 것.
  • 증거 하한 경계(ELBO) 원리를 적용하여 정책의 변분 근사 최적화를 수행함으로써 최대 엔트로피 RL과 정규화 흐름 학습을 연결하는 것.
  • 모든 NF 레이어를 단일 보상 신호에서 동시에 학습시켜 계층적 또는 다단계 최적화를 피하는 것.
  • 재플리케이션 버퍼와 소프트 Q-학습 업데이트를 사용하여 이완정책 학습을 유지하고, 유연성 변환 정책를 통해 엔트로피 정규화를 그대로 유지하는 것.
  • 유연성 변환 레이어를 통해 역전파를 수행할 수 있는 재구성 기법을 적용하여 정책의 엔드 투 엔드 학습을 가능하게 하는 것.

실험 결과

연구 질문

  • RQ1정규화 흐름이 SAC와 같은 이완정책 RL 알고리즘에서 탐색 성능을 크게 향상시킬 수 있는가?
  • RQ2정규화 흐름을 통해 다중모드 정책를 사용할 경우, 희박한 보상 환경에서 더 빠른 수렴과 높은 성능을 달성할 수 있는가?
  • RQ3어느 정도까지 정규화 흐름을 통해 연속 제어 과제에서 효과적인 정책 표현을 위해 필요한 파라미터 수를 줄일 수 있는가?
  • RQ4SAC 내에서 레이디얼, 플레인, IAF 등의 다양한 종류의 정규화 흐름이 성능 및 효율성 측면에서 어떻게 비교되는가?
  • RQ5SAC-NF는 PyBullet Roboschool와 같은 실제적인 시뮬레이션-실세계 전이 과제에서 더 나은 일반화 성능을 보일 수 있는가?

주요 결과

  • SAC-NF는 6개의 MuJoCo 환경에서 최신 기준 성능을 달성하였으며, 모든 과제에서 표준 SAC를 뛰어넘는 성능을 보였다.
  • 희박한 보상 환경인 SparseHumanoid-v2에서 SAC-NF는 547 ± 268의 보상 수익을 기록하였고, 이는 SAC의 88 ± 159에 비해 뚜렷한 향상이다.
  • PyBullet Roboschool 과제에서는 레이디얼 흐름 기반의 SAC-NF가 히ュ먼로이드에서 1755 ± 131의 보상 수익을 기록하였고, 이는 SAC의 1263 ± 290보다 높은 성능을 보였다. 이는 현실적인 물리 환경에서의 일관된 성능 향상을 보여준다.
  • Hopper-v2 환경에서 SAC-NF는 표준 SAC가 필요로 하는 파라미터 수의 5.5%인 3,861개만을 사용하였고, 이는 70,406개의 파라미터를 요구하는 표준 SAC보다 훨씬 작은 모델이면서도 더 뛰어난 성능을 달성하였다.
  • SAC-NF의 레이디얼 흐름 변종은 대부분의 과제에서 플레인 및 IAF 흐름보다 더 일관된 성능을 보였으며, 가장 우수한 성능을 기록하였다.
  • SAC-NF는 더 빠른 수렴과 더 나은 샘플 효율성을 보였으며, 여러 랜덤 시드에서 부드러운 학습 곡선과 감소된 분산을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.