Skip to main content
QUICK REVIEW

[논문 리뷰] Mean-Variance Policy Iteration for Risk-Averse Reinforcement Learning

Shangtong Zhang, Bo Liu|arXiv (Cornell University)|2020. 04. 22.
Reinforcement Learning in Robotics참고 문헌 72인용 수 5
한 줄 요약

이 논문은 평균-분산 정책 반복(MVPI)을 소개한다. MVPI는 확장된 MDP를 통해 단계별 보상의 분산을 최적화함으로써 위험 회피 강화학습을 위한 유연한 프레임워크를 제공한다. 펜첼 이중성과 블록 순환 좌표 상승을 활용하여 MVPI는 비정책 기반 및 결정론적 정책 학습을 가능하게 하며, Mujoco 벤치마크에서 이전 방법들보다 뛰어난 성능을 기록한다. 이는 위험 회피 강화학습에서 비정책 기반 및 결정론적 정책의 첫 성공적인 적용을 의미한다.

ABSTRACT

We present a mean-variance policy iteration (MVPI) framework for risk-averse control in a discounted infinite horizon MDP optimizing the variance of a per-step reward random variable. MVPI enjoys great flexibility in that any policy evaluation method and risk-neutral control method can be dropped in for risk-averse control off the shelf, in both on- and off-policy settings. This flexibility reduces the gap between risk-neutral control and risk-averse control and is achieved by working on a novel augmented MDP directly. We propose risk-averse TD3 as an example instantiating MVPI, which outperforms vanilla TD3 and many previous risk-averse control methods in challenging Mujoco robot simulation tasks under a risk-aware performance metric. This risk-averse TD3 is the first to introduce deterministic policies and off-policy learning into risk-averse reinforcement learning, both of which are key to the performance boost we show in Mujoco domains.

연구 동기 및 목표

  • 위험 중립적과 위험 회피적 강화학습 간의 성능 격차를 해소하기 위해 위험 회피 설정에서 비정책 기반 및 결정론적 정책 학습을 가능하게 하는 것.
  • 펜첼 이중성을 사용하여 평균-분산 강화학습에서 정책에 의존하는 보상 문제를 해결하고, 블록 순환 좌표 상승을 통해 이를 효과적으로 다루는 것.
  • 모든 위험 중립적 정책 평가 및 제어 방법을 통합할 수 있는 융통성 있는 프레임워크를 제안하는 것.
  • Mujoco 로봇 제어 작업에서 비정책 기반 및 결정론적 정책을 사용한 위험 회피 강화학습의 첫 실증적 성공을 보여주는 것.
  • 복잡한 환경에서 총 보상의 분산을 최소화하는 데 스케일러블한 대체 지표로 단계별 보상의 분산을 최적화하는 것.

제안 방법

  • MVPI는 상태 공간을 정책의 평균과 분산을 포함하도록 확장하여, 기대 수익과 위험을 함께 최적화할 수 있는 확장된 MDP를 구성한다.
  • 이 프레임워크는 정책에 의존하는 보상 문제를 해결 가능한 볼록 최적화 문제로 변환하기 위해 펜첼 이중성을 사용하며, 정책과 가치 함수 학습을 분리한다.
  • 블록 순환 좌표 상승(BCAA)을 사용하여 정책과 가치 함수를 반복적으로 최적화함으로써 정책에 의존하는 보상이 존재하는 상황에서도 수렴을 보장한다.
  • 밀도 비율 추정을 통해 행동 정책를 목표 정책에서 분리함으로써 비정책 학습과 정책 학습을 모두 지원한다.
  • 위험 회피 TD3는 MVPI 내에서 특정 알고리즘으로 구현되며, 비정책 학습, 결정론적 정책, 분산 정규화를 결합한다.
  • MVPI는 모든 위험 중립적 강화학습 알고리즘과 호환되며, 기존 방법들을 위험 회피 제어에 즉시 통합할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1위험 회피 강화학습에서 비정책 기반 및 결정론적 정책 학습을 가능하게 하는 통합 프레임워크를 설계할 수 있는가?
  • RQ2단계별 보상의 분산을 최적화하는 것이 총 할인 보상의 분산을 최소화하는 데 효과적이고 스케일러블한 대체 지표가 될 수 있는가?
  • RQ3정책에 의존하는 보상—보상 함수가 정책에 따라 달라지는 경우—은 평균-분산 강화학습에서 어떻게 효과적으로 다룰 수 있는가?
  • RQ4MVPI는 기존의 위험 중립적 정책 최적화 방법(정책 기반 및 비정책 기반 모두)과 호환될 수 있는가?
  • RQ5위험 회피 강화학습에 비정책 학습과 결정론적 정책을 통합하면 복잡한 제어 과제에서 측정 가능한 성능 향상이 이루어지는가?

주요 결과

  • MVPI 내에서 구현된 위험 회피 TD3는 위험 인식 성능 지표 하에서 도전적인 Mujoco 로봇 제어 과제에서 원래의 TD3 및 모든 이전의 평균-분산 강화학습 방법보다 뛰어난 성능을 기록한다.
  • MVPI는 위험 회피 강화학습에서 비정책 학습을 위한 첫 성공적인 적용을 가능하게 하여 데이터 효율성과 학습 안정성을 크게 향상시켰다.
  • MVPI 내에서 결정론적 정책를 사용함으로써 정책의 분산이 감소하고 시뮬레이션에서 더 매끄럽고 신뢰할 수 있는 트레이젝터리가 도출되었다.
  • 펜첼 이중성과 BCAA를 통해 MVPI는 정책에 의존하는 보상 문제를 효과적으로 다루며, 비정적 상태의 MDP에서도 수렴을 보였다.
  • 이 프레임워크는 확장성과 융통성을 입증하였으며, 다양한 위험 중립적 알고리즘을 위험 회피 제어에 즉시 통합할 수 있도록 지원한다.
  • 실증 결과는 위험 회피 정도(λ)가 증가할수록 고위험 행동 선택 확률이 감소하는 것을 확인하였으며, 이는 효과적인 위험 캘리브레이션을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.