Skip to main content
QUICK REVIEW

[논문 리뷰] Randomized Value Functions via Multiplicative Normalizing Flows

Abdelaziz Touati, Harsh Satija|arXiv (Cornell University)|2018. 06. 06.
Reinforcement Learning in Robotics참고 문헌 39인용 수 15
한 줄 요약

이 논문은 깊이 강화 학습 네트워크인 딥 Q 네트워크(DQN)와 DDPG 에이전트에서 풍부하고 구조화된 불확실성을 모델링하기 위해 곱셈형 정규화 흐름(MNFs)을 도입하며, 탐색을 위한 효율적인 톰슨 샘플링을 가능하게 한다. 가치 함수 매개수에 대한 복잡한 사후 분포를 근사화함으로써, 이 방법은 뛰어난 샘플 효율성을 달성하고 아타리 및 연속 제어 환경에서 최신 탐색 기준보다 뛰어난 성능을 보인다.

ABSTRACT

Randomized value functions offer a promising approach towards the challenge of efficient exploration in complex environments with high dimensional state and action spaces. Unlike traditional point estimate methods, randomized value functions maintain a posterior distribution over action-space values. This prevents the agent's behavior policy from prematurely exploiting early estimates and falling into local optima. In this work, we leverage recent advances in variational Bayesian neural networks and combine these with traditional Deep Q-Networks (DQN) and Deep Deterministic Policy Gradient (DDPG) to achieve randomized value functions for high-dimensional domains. In particular, we augment DQN and DDPG with multiplicative normalizing flows in order to track a rich approximate posterior distribution over the parameters of the value function. This allows the agent to perform approximate Thompson sampling in a computationally efficient manner via stochastic gradient methods. We demonstrate the benefits of our approach through an empirical comparison in high dimensional environments.

연구 동기 및 목표

  • 희박한 보상이 존재하는 고차원 강화 학습 환경에서 효율적인 탐색 문제를 해결하기 위해.
  • 변분 추론을 사용하여 가치 함수 매개수의 풍부하고 구조화된 불확실성을 모델링하여 샘플 효율성을 향상시키기 위해.
  • 정규화 흐름과 DQN 및 DDPG를 결합하여 베이지안 딥 강화 학습을 복잡한 고차원 영역으로 확장하기 위해.
  • 딥 신경망에서의 근사 사후 추론을 통해 계산적으로 효율적인 톰슨 샘플링을 가능하게 하기 위해.
  • 표준 벤치마크, 즉 아타리 게임과 오픈AI 겸지 연속 제어 작업에서 방법을 검증하기 위해.

제안 방법

  • 딥 Q 네트워크(DQN)와 DDPG에 다중 곱셈형 정규화 흐름(MNFs)을 통합하여 가치 함수 매개수에 대한 민첩하고 근사적인 사후 분포를 모델링한다.
  • MNFs를 사용하여 신경망 가중치 간의 복잡하고 임의의 종속성을 포착함으로써, 독립적인 매개수 사전보다 더 풍부한 불확실성 표현을 가능하게 한다.
  • 학습된 가치 함수에 대한 사후 분포에서 샘플을 추출함으로써 근사 톰슨 샘플링을 수행하기 위해 확률적 경량 방법을 적용한다.
  • 정규화 흐름 기반 사후 분포를 사용한 변분 추론을 통해 불확실성 추정에서 계산 효율성과 표현력의 균형을 맞춘다.
  • 표준 강화 학습 목표와 주변 가능성의 변분 하한을 결합한 미분 가능한 손실을 사용하여 모델을 종합적으로 훈련시킨다.
  • 탐색과 이용의 균형을 맞추기 위해 정규화 강도 λ와 흐름 깊이와 같은 하이퍼파라미터를 튜닝한다.

실험 결과

연구 질문

  • RQ1곱셈형 정규화 흐름은 고차원 강화 학습에서 효율적인 탐색을 위한 깊이 가치 함수의 불확실성을 효과적으로 모델링할 수 있는가?
  • RQ2제안된 방법은 아타리 환경에서 기존의 탐색 기준인 ε-그리디, 노이지넷, 부트스트랩 DQN보다 뛰어나게 성능을 발휘하는가?
  • RQ3희박한 보상 환경에서 MNF 기반 탐색 전략은 내재적 호기심과 의사수치 방법과 비교해 어떻게 성능을 내는가?
  • RQ4이 방법은 연속 제어 작업으로 확장될 수 있으며, 계산 효율성과 샘플 효율성을 유지할 수 있는가?
  • RQ5MNF가 제공하는 더 풍부한 사후 구조는 단순한 확률적 매개수 파라미터화 방법보다 더 효과적인 톰슨 샘플링을 이끌어내는가?

주요 결과

  • MNF-DQN은 보상이 희박한 어려운 탐색 게임인 그라비타르에서 ε-그리디와 노이지넷보다 뛰어난 샘플 효율성을 보이며 개선된 성능을 입증한다.
  • 13개의 아타리 게임에서 MNF-DQN은 6개 게임에서 부트스트랩 DQN보다 뚜렷이 뛰어나며, 4개 게임에서는 동일하고 3개 게임 뿐에서 뒤지며, 일관되고 경쟁 가능한 성능을 보였다.
  • 하프체타 환경에서 MNF-DDPG는 DDPG에 오스노이즈를 적용한 것과 노이지넷을 포함한 모든 기준보다 더 높은 평균 수익을 달성하여 연속 제어에서 뛰어난 탐색 능력을 입증했다.
  • 특히 보상이 희박한 환경에서 깊은 탐색이 요구되는 환경에서, 이 방법은 BBQN 및 노이지넷 기준보다 더 뛰어난 성능을 발휘했다.
  • MNF 추론의 계산 비용은 모델 매개수의 수에 따라 선형적으로 증가하므로, 대규모 딥 강화 학습에 실용적이다.
  • 오스반드 등(2018)의 무작위 사전 함수 기준은 표준 부트스트랩 DQN보다 성능 향상이 없었으며, 이는 MNF의 구조화된 사후 분포의 우수성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.