Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient and Robust Reinforcement Learning with Uncertainty-based Value Expansion

Bo Zhou, Hongsheng Zeng|arXiv (Cornell University)|2019. 12. 10.
Reinforcement Learning in Robotics참고 문헌 35인용 수 6
한 줄 요약

이 논문은 불확실성 모델링을 통해 모델 기반 가치 확장의 성능을 햖थ하고, 확률적 동역학 모델의 앙상블과 동적 신뢰도 하한(Confidence Lower Bound, CLB)을 활용하여 과도한 가치 추정을 줄이고 강건성을 향상시키는 하이브리드 강화학습 방법인 Risk Averse Value Expansion(RAVE)을 제안한다. RAVE는 불확실성 모델링을 통해 과도한 가치 추정을 줄이고 강건성을 향상시키며, NeurIPS 2019 'Learn to Move' 챌린지에서 2위 메서드보다 144점 앞서는 최고 성능을 기록하여 1위를 차지하였다.

ABSTRACT

By integrating dynamics models into model-free reinforcement learning (RL) methods, model-based value expansion (MVE) algorithms have shown a significant advantage in sample efficiency as well as value estimation. However, these methods suffer from higher function approximation errors than model-free methods in stochastic environments due to a lack of modeling the environmental randomness. As a result, their performance lags behind the best model-free algorithms in some challenging scenarios. In this paper, we propose a novel Hybrid-RL method that builds on MVE, namely the Risk Averse Value Expansion (RAVE). With imaginative rollouts generated by an ensemble of probabilistic dynamics models, we further introduce the aversion of risks by seeking the lower confidence bound of the estimation. Experiments on a range of challenging environments show that by modeling the uncertainty completely, RAVE substantially enhances the robustness of previous model-based methods, and yields state-of-the-art performance. With this technique, our solution gets the first place in NeurIPS 2019: Learn to Move.

연구 동기 및 목표

  • 스토케스틱 환경에서 모델 기반 강화학습의 낮은 강건성과 높은 기능 근사 오차 문제를 해결하기 위해.
  • 모델 프리 및 하이브리드 강화학습 프레임워크에 불확실성 모델링을 통합하여 샘플 효율성과 가치 추정 정확도를 향상시키기 위해.
  • 위험 회피적 신뢰도 하한을 통해 가치 함수 학습 시 과도한 가치 추정 편향을 줄이기 위해.
  • 가치 추정에서 신뢰도 하한을 동적으로 조정하여 탐색과 이용의 균형을 이루기 위해.
  • 도전적이고 고위험 기반의 강화학습 환경, 특히 NeurIPS 2019 'Learn to Move' 챌린지에서 최고 성능을 달성하기 위해.

제안 방법

  • RAVE는 환경 전이의 이얼레틱(aleatoric) 및 엡스테믹(aleatoric) 불확실성을 모두 포착하기 위해 확률적 동역학 모델의 앙상블을 사용하여 모델 기반 가치 확장(MVE)을 확장한다.
  • 앙성의 확률적 모델에서 상상적 롤아웃을 생성하여 향후 수익과 가치 함수를 예측한다.
  • 예측된 가치 분포에 α-신뢰도 하한(α-CLB)을 적용하여 과도하게 낙관적인 행동 선택을 방지하는 보수적인 위험 회피적 가치 추정을 선호한다.
  • 학습 중에 α 파라미터를 동적으로 조정하여 위험 회피성과 탐색의 균형을 이루며, 학습 안정성과 수렴성을 향상시킨다.
  • 가치 함수 타겟은 앙성 예측의 하한 신뢰도를 사용하여 분산을 줄이고 일반화 능력을 향상시킨다.
  • 추론 시에는 단지 훈련된 정책만 사용하므로 계산 비용이 효율적이며, 기준 방법 대비 훈련 시간 증가 폭이 미미하다.

실험 결과

연구 질문

  • RQ1환경 동역학의 이얼레틱 및 엡스테믹 불확실성을 모두 모델링하면, 스토케스틱 환경에서 모델 기반 가치 확장의 강건성이 향상되는가?
  • RQ2가치 예측에 대한 신뢰도 하한을 적용하면 과도한 가치 추정이 줄어들고 고위험 강화학습 과제에서 정책 성능이 향상되는가?
  • RQ3신뢰도 하한 파라미터 α의 동적 조정이 학습 안정성과 샘플 효율성에 어떤 영향을 미치는가?
  • RQ4모델 기반 롤아웃과 위험 회피적 가치 추정을 조합한 하이브리드 강화학습 방법이 최고 성능의 모델 프리 및 하이브리드 기준보다 뛰어난가?
  • RQ5실제 고위험 제어 과제, 예를 들어 'Learn to Move' 챌린지에서 불확실성 인식 가치 추정이 성능 향상에 얼마나 기여하는가?

주요 결과

  • RAVE는 NeurIPS 2019 'Learn to Move' 챌린지에서 1위를 차지하여 2위 메서드보다 144점 높은 성능을 기록하였다.
  • Hopper-v1 환경에서 RAVE는 DDPG와 STEVE에 비해 예측된 Q-값과 진짜 값 간의 일치도가 뚜렷이 향상되었으며, 과도한 가치 추정이 감소하였다.
  • 동적 α-CLB 버전의 RAVE는 고정된 α 설정 대비 더 빠른 수렴과 더 안정적인 성능을 보였으며, 탐색과 위험 회피의 균형을 효과적으로 유지하였다.
  • RAVE는 'LearnToRun' 환경에서 에이전트의 추락 비율을 1.3%로 줄였으며, DDPG의 15% 대비 뛰어난 강건성을 입증하였다.
  • RAVE의 훈련 비용은 STEVE 대비 단지 24.29% 증가하였고, 추론 비용은 표준 모델 프리 방법과 동일했다.
  • 확률적 앙성 모델의 사용은 환경의 확률적 특성(이얼레틱)과 모델 불확실성(엡스테믹)을 모두 포착함으로써 가치 추정 정확도를 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.