Skip to main content
QUICK REVIEW

[논문 리뷰] Epistemic Risk-Sensitive Reinforcement Learning

Hannes Eriksson, Christos Dimitrakakis|arXiv (Cornell University)|2019. 06. 14.
Reinforcement Learning in Robotics참고 문헌 27인용 수 7
한 줄 요약

이 논문은 β로 파arameter화된 유틸리티 함수를 사용하여 지식 부족에 의한 에피스테믹 불확실성에 대한 리스크 민감도를 모델링하는 베이지안 강화 학습 프레임워크를 제안한다. 이는 리스크 회피, 리스크 중립, 리스크 유도 행동을 가능하게 하며, 유틸리티 기반 수익 최적화를 통한 리스크 제어를 위한 동적 프ogramming 및 정책 그래디언트 알고리즘을 제안한다. 이는 이산 및 연속 상태 공간을 가진 불확실한 MDP 환경에서 탐색을 감소시키고 강건성을 향상시킴을 보여준다.

ABSTRACT

We develop a framework for interacting with uncertain environments in reinforcement learning (RL) by leveraging preferences in the form of utility functions. We claim that there is value in considering different risk measures during learning. In this framework, the preference for risk can be tuned by variation of the parameter $β$ and the resulting behavior can be risk-averse, risk-neutral or risk-taking depending on the parameter choice. We evaluate our framework for learning problems with model uncertainty. We measure and control for \emph{epistemic} risk using dynamic programming (DP) and policy gradient-based algorithms. The risk-averse behavior is then compared with the behavior of the optimal risk-neutral policy in environments with epistemic risk.

연구 동기 및 목표

  • 에피스테믹 불확실성 하에서 리스크 민감도 강화 학습을 위한 통합 프레임워크를 개발하는 것. 여기서 불확실성은 MDP에 대한 지식 부족에서 기인한다.
  • β 매개변수를 통해 리스크 선호도를 조정할 수 있는 유틸리티 함수를 사용하여 리스크 민감도를 모델링하는 것.
  • 모델 불확실성 환경에서 리스크 회피 정책과 리스크 중립 정책을 비교하는 것.
  • 이산(그리드월드) 및 연속(옵션 가격 정책) 환경에서 유틸리티 기반 리스크 민감도의 성능을 평가하는 것.
  • 리스크 회피 정책이 에피스테믹 불확실성 하에서 탐색을 감소시키고 강건성을 향상시킴을 보여주는 것.

제안 방법

  • 수익 R의 기대 유틸리티를 통해 리스크 민감도를 정식화하며, 오목한 유틸리티 함수는 리스크 회피를, 볼록한 함수는 리스크 유도 행동을 유도한다.
  • MDP μ에 대한 베이지안 믿음 ξ를 사용하여 최적 정책을 argmaxπ ∫ℳ 𝔼μ^π[U(R)] dξ(μ)로 계산하며, 모델 불확실성에 통합한다.
  • 이산 MDP에는 동적 프로그래밍(ADP)을, 연속 상태 공간에는 베이지안 정책 그래디언트(EBPG) 알고리즘을 사용한다.
  • 환경의 에피스테믹 불확실성을 모델링하기 위해 보상 함수와 전이 커널에 대해 가우시안 프로세스 사전분포를 적용한다.
  • 유틸리티 함수 U(R) = -exp(-βR)에서 β를 조절함으로써 리스크 선호도를 조절하며, β > 0은 리스크 회피, β = 0은 리스크 중립, β < 0은 리스크 유도를 의미한다.
  • 사후 믿음에서 MDP를 몬테카를로 샘플링하여 기대 유틸리티를 추정하고 정책을 업데이트한다.

실험 결과

연구 질문

  • RQ1에피스테믹 불확실성에 대한 리스크 민감도는 부분 관측 가능한 MDP에서 정책 학습과 탐색 행동에 어떻게 영향을 미치는가?
  • RQ2조절 가능한 β 매개변수를 가진 유틸리티 기반 리스크 민감도는 이용과 탐색 간의 트레이드오���을 효과적으로 제어할 수 있는가?
  • RQ3모델 불확실성 하에서 리스크 회피 정책과 리스크 중립 정책 간의 실수 수와 실패 비율 측면에서의 성능 비교는 어떠한가?
  • RQ4유틸리티 기반 리스크 민감도는 연속 상태 공간 환경에서의 학습 안정성과 수렴에 어떤 영향을 미치는가?
  • RQ5보상 형태의 보정이나 엔트로피 정규화 없이도 유틸리티 함수를 사용해 구조화된 탐색을 유도할 수 있는가?

주요 결과

  • 리스크 회피 정책(β > 0)은 리스크 중립 정책에 비해 탐색이 크게 감소하여 그리드월드 환경에서 실수 수가 낮아졌다.
  • 그리드월드 실험에서 리스크 회피 정책는 리스크 중립 정책과 거의 동일한 성능을 달성하였으며, 실패 수(낙상 수)가 약간 증가하는 정도였다.
  • β = -0.001일 경우 정책은 지나치게 경계가 되었고, β = -0.01 및 β = -0.1은 리스크 중립 PG와 유사한 행동을 보여, 리스크 유도 행동에서 임계점 효과가 있음을 시사했다.
  • 베이지안 정책 그래디언트(EBPG) 알고리즘이 연속 상태 공간 환경에서 리스크 민감 정책을 성공적으로 학습하였지만, MDP 샘플링이 비용이 많이 들기 때문에 학습 속도가 느렸다.
  • CVaR 기반 정책과 β = -0.001 정책는 지나치게 보수적이었으며, 작은 β를 가진 유틸리티 기반 리스크 민감도가 최적의 탐색을 이끌 수 없음을 시사했다.
  • 이 프레임워크는 기존 강화 학습 알고리즘을 수정하지 않고도 β를 통해 리스크 선호도를 조절할 수 있어, 에피스테믹 불확실성 처리에 있어 높은 유연성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.