Skip to main content
QUICK REVIEW

[논문 리뷰] Risk-Averse Bayes-Adaptive Reinforcement Learning

Marc Rigter, Bruno Lacerda|arXiv (Cornell University)|2021. 02. 10.
Reinforcement Learning in Robotics참고 문헌 51인용 수 6
한 줄 요약

이 논문은 베이지안 적응형 MDP에서 총 보상의 조건부가치위험(CVaR)을 최적화하여 지식 부족 불확실성(epistemic)과 본질적 불확실성(aleatoric)을 동시에 다루는 Risk-Averse Bayes-Adaptive Monte Carlo Tree Search(RA-BAMCP) 알고리즘을 제안한다. 문제를 이인자 스토케스틱 게임으로 재구성하고 몬테카를로 트리 탐색과 베이지안 최적화를 융합함으로써, 베팅 및 주행 도메인에서 기존 기준보다 뛰어난 위험 회피 성능을 달성하였으며, 특히 열악한 수익을 초래할 가능성을 줄였다.

ABSTRACT

In this work, we address risk-averse Bayes-adaptive reinforcement learning. We pose the problem of optimising the conditional value at risk (CVaR) of the total return in Bayes-adaptive Markov decision processes (MDPs). We show that a policy optimising CVaR in this setting is risk-averse to both the parametric uncertainty due to the prior distribution over MDPs, and the internal uncertainty due to the inherent stochasticity of MDPs. We reformulate the problem as a two-player stochastic game and propose an approximate algorithm based on Monte Carlo tree search and Bayesian optimisation. Our experiments demonstrate that our approach significantly outperforms baseline approaches for this problem.

연구 동기 및 목표

  • 지식 부족 불확실성과 본질적 불확실성이 동시에 존재하는 모델 기반 베이지안 강화학습 환경에서 위험 회피 의사결정 문제를 해결하기 위해.
  • 베이지안 적응형 MDP(BAMDP)에서 총 보상의 조건부가치위험(CVaR)을 최적화하여 희귀하지만 영향력이 큰 부정적 결과에 대한 강건성을 확보하기 위해.
  • 확장된 상태공간의 지수적 증가와 적대적 환경의 연속적 행동공간을 다룰 수 있는 효율적인 알고리즘 개발을 위해.
  • CVaR를 통한 지식 부족 불확실성과 본질적 불확실성의 통합적 완화가 기대값 최적화나 위험 간과 기반 방법보다 더 신뢰성 있고 안전한 정책을 도출함을 보여주기 위해.
  • 스토케스틱 게임 수식과 확장 가능한 근사 추론을 활용해 불확실한 환경에서의 위험 회피 계획을 위한 새로운 프레임워크를 수립하기 위해.

제안 방법

  • 문제를 에이전트와 적대적 환경 간의 이인자 스토케스틱 게임으로 재구성하여, 적대적 환경이 에이전트의 CVaR를 최소화하도록 행동을 선택하도록 설정한다.
  • 몬테카를로 트리 탐색(MCTS)을 사용해 MDP에 대한 믿음과 환경 상태를 포함한 확장된 상태공간을 탐색한다.
  • 적대적 플레이어의 연속 행동공간에서 유망한 행동을 효율적으로 확장하기 위해 베이지안 최적화를 적용한다.
  • 각 MCTS 노드에서 사후 분포를 갱신하여 불확실성을 트리 전체에 전파하는 방식으로 MDP에 대한 믿음 분포를 유지한다.
  • CVaR 목적함수는 수익 분포 기반으로 계산되며, 위험 수준 α는 악성 결과에 대한 신뢰 수준을 조절한다.
  • 각 노드의 사후 계산이 필요하기 때문에 루트 샘플링을 피함으로써 확장성은 제한되지만 믿음 갱신의 정확성을 유지한다.

실험 결과

연구 질문

  • RQ1베이지안 적응형 MDP에서 CVaR 최적화가 지식 부족 불확실성과 본질적 불확실성으로 인한 열악한 결과의 위험을 효과적으로 줄일 수 있는가?
  • RQ2CVaR 기반 위험 회피 정책은 불확실한 환경에서 기대값 최적화나 위험 간과 기반 기준보다 어떻게 성능이 뛰어나게 되는가?
  • RQ3MCTS와 베이지안 최적화의 조합이 고차원적이고 불확실한 MDP에서 확장 가능하고 효과적인 CVaR 최적화를 가능하게 하는 정도는 어느 정도인가?
  • RQ4제안된 적대적 환경를 포함한 스토케스틱 게임 수식은 기존의 베이지안 강화학습 접근보다 더 강건한 정책을 도출하는가?
  • RQ5CVaR 지표의 위험 수준 α 선택에 따라 알고리즘 성능이 얼마나 민감하게 영향을 받는가?

주요 결과

  • 베팅 게임 도메인에서 RA-BAMCP는 α=0.03일 때 CVaR 23.51, α=0.2일 때 18.91을 기록하여, 특히 낮은 α에서 기대값 기반 EMDP 및 BAMDP PG보다 열악한 수익을 훨씬 더 효과적으로 줄였다.
  • 자율주행 자동차 주행 도메인에서 RA-BAMCP는 α=0.03일 때 CVaR 25.41, α=0.2일 때 27.76를 기록하여, 높은 기대값을 유지하면서도 강력한 위험 회피 성능을 보였다.
  • BAMCP는 기대값 최적화를 수행하여 가장 높은 기대 수익(50.16)을 기록했지만, 분산이 크고 CVaR가 열악하여 열악한 결과 발생 위험이 높았다.
  • CVaR BAMDP 정책 그래디언트 방법은 α=0.03일 때 CVaR=10.05로 성능이 열악했고, 국소 최소값에 매우 민감하여 낮은 신뢰도 설정에서 불안정성을 보였다.
  • 제거 실험을 통해 베이지안 최적화를 통한 행동 확장이 필수적임을 확인하였으며, 동일한 계산 예산에서 랜덤 행동 확장은 성능을 크게 떨어뜨렸다.
  • 수익 히스토GRAM 분석 결과 RA-BAMCP는 수익 분포의 왼쪽 尾(꼬리)를 오른쪽으로 이동시켜 극단적인 부정적 결과의 발생 확률을 감소시켰으며, 이는 위험 회피 성향을 확인하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.