Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Exploration in Soft-Actor-Critic with Normalizing Flows Policies

Patrick Ward, Ariella Smofsky|arXiv (Cornell University)|2019. 06. 06.
Reinforcement Learning in Robotics참고 문헌 17인용 수 15
한 줄 요약

이 논문은 소프트 액터-크리틱(SAC)에서 탐색을 향상시키기 위해 표준 인과적 가우시안 정책을 노멀라이징 플로우 정책으로 대체함으로써, 재표본화를 유지하면서도 더 표현력 있고 민첩한 분포를 학습한다. 이 방법은 희소 보상이 주어지는 연속 제어 과제에서 훨씬 더 빠르고 효과적인 탐색을 가능하게 하여 가우시안 및 지수 정책보다 뛰어난 성능을 달성한다.

ABSTRACT

Deep Reinforcement Learning (DRL) algorithms for continuous action spaces are known to be brittle toward hyperparameters as well as \cut{being}sample inefficient. Soft Actor Critic (SAC) proposes an off-policy deep actor critic algorithm within the maximum entropy RL framework which offers greater stability and empirical gains. The choice of policy distribution, a factored Gaussian, is motivated by \cut{chosen due}its easy re-parametrization rather than its modeling power. We introduce Normalizing Flow policies within the SAC framework that learn more expressive classes of policies than simple factored Gaussians. \cut{We also present a series of stabilization tricks that enable effective training of these policies in the RL setting.}We show empirically on continuous grid world tasks that our approach increases stability and is better suited to difficult exploration in sparse reward settings.

연구 동기 및 목표

  • SAC에서 인과적 가우시안 정책의 표현력이 제한되어 복잡하거나 희소 보상 환경에서 탐색이 제한되는 문제를 해결하기 위해.
  • 노멀라이징 플로우를 통해 모델링된 더 표현력 있는 정책 분포, 예를 들어 노멀라이징 플로우 정책이 연속 제어 과제에서 샘플 효율성과 학습 안정성에 기여하는지 조사하기 위해.
  • 다양한 정책 가족과 기울기 추정기의 영향을 조밀한 보상 및 희소 보상 그리드 월드 환경에서 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • SAC의 재표본화된 인과적 가우시안 정책을 RealNVP 아키텍처 기반의 노멀라이징 플로우 정책으로 대체하여, 단순한 기본 분포에서 유연하고 정규화 가능한 변환을 가능하게 한다.
  • 변환 공식을 사용하여 밀도를 다룰 수 있도록 하고, 경로 기반 기울기 추정기로 기울기 계산을 가능하게 한다.
  • 노멀라이징 플로우 정책을 SAC의 최대 엔트로피 강화학습 프레임워크에 통합하여, 오프-폴리시 학습과 엔트로피 정규화를 유지한다.
  • 가중치 초기화와 기울기 클리핑과 같은 안정화 기법을 적용하여 강화학습에서 플로우 기반 정책의 안정적 훈련을 가능하게 한다.
  • SAC에서 사용하는 압축 함수(tanh)를 한 층의 플로우로 기준선으로 삼고, 표현력 향상을 위해 더 깊고 복잡한 플로우로 확장한다.
  • 낮은 분산 업데이트를 위해 경로 기반 기울기 추정기를 사용하여 정책을 훈련시키며, REINFORCE 및 기타 정책 가족과의 성능 비교를 수행한다.

실험 결과

연구 질문

  • RQ1예를 들어 가우시안, 지수, 노멀라이징 플로우와 같은 정책 분포의 선택이 조밀한 보상 및 희소 보상 환경에서 학습 성능에 어떤 영향을 미치는가?
  • RQ2노멀라이징 플로우 정책의 맥락에서, REINFORCE와 경로 기반 기울기 추정기의 차이가 정책 학습과 수익 안정성에 어떤 영향을 미치는가?
  • RQ3희소 보상이 주어지는 연속 그리드 월드 과제에서, 노멀라이징 플로우 정책의 탐색 행동은 가우시안 정책과 어떻게 다를까?
  • RQ4표준 가우시안 정책보다 노멀라이징 플로우 정책이 희소 보상 환경에서 더 빠른 수렴과 높은 수익을 달성할 수 있는가?
  • RQ5더 표현력 있는 정책 분포를 사용하면 연속 제어 과제에서 샘플 효율성과 강인성이 향상되는가?

주요 결과

  • 희소 보상 환경에서는 노멀라이징 플로우 정책이 가우시안 및 지수 정책보다 목표 상태에 훨씬 빨리 도달하며, 일부 실험에서는 최적의 수익을 거의 즉시 달성한다.
  • 조밀한 보상 설정에서는 노멀라이징 플로우 정책가 가우시안 정책과 유사한 속도로 최적 성능에 수렴하여 추가 오버헤드가 거의 없음을 보여준다.
  • REINFORCE 기울기 추정기는 모든 정책 유형에서 성능의 분산이 더 높았지만, 최종 수익은 경로 기반 추정기와 유사했다.
  • 노멀라이징 플로우 정책는 희소 보상 환경에서 목표 상태 근처에 집중적으로 탐색하는 경향을 보이며, 반면 가우시안 정책는 낮은 보상 영역에서 비효율적으로 탐색한다.
  • 조밀한 보상 설정에서는 노멀라이징 플로우 정책가 초기 보조 목표를 초과 탐색하지 않지만, 가우시안 정책는 비보상 영역을 자주 방문한다.
  • 정책 분포의 선택은 성능에 큰 영향을 미치며, 노멀라이징 플로우 정책는 조밀한 보상과 희소 보상 과제 모두에서 표현력과 안정성 사이의 유리한 균형을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.