Skip to main content
QUICK REVIEW

[논문 리뷰] A Convex Programming Approach to Data-Driven Risk-Averse Reinforcement Learning

Yuzhen Han, Majid Mazouchi|arXiv (Cornell University)|2021. 03. 26.
Adaptive Dynamic Programming Control참고 문헌 49인용 수 4
한 줄 요약

이 논문은 이산 시간 비선형 시스템에서 위험 회피 최적 제어를 위한 축합 프ogramming 기반 강화 학습 프레임워크를 제안한다. 사전에 수집된 데이터를 사용하여 온라인 탐색을 피한다. 정적 축합 프로그램, 값 반복, 정책 반복의 세 가지 알고리즘을 도입하며, 각 알고리즘은 이론적 오차 한계를 보장하면서 위험 회피 최적 정책으로 수렴함을 보여준다. 시뮬레이션에서 위험 중립적 방법에 비해 뛰어난 안정성과 분산 감소 성능을 입증한다.

ABSTRACT

This paper presents a model-free reinforcement learning (RL) algorithm to solve the risk-averse optimal control (RAOC) problem for discrete-time nonlinear systems. While successful RL algorithms have been presented to learn optimal control solutions under epistemic uncertainties (i.e., lack of knowledge of system dynamics), they do so by optimizing the expected utility of outcomes, which ignores the variance of cost under aleatory uncertainties (i.e., randomness). Performance-critical systems, however, must not only optimize the expected performance, but also reduce its variance to avoid performance fluctuation during RL's course of operation. To solve the RAOC problem, this paper presents the following three variants of RL algorithms and analyze their advantages and preferences for different situations/systems: 1) a one-shot static convex program -based RL, 2) an iterative value iteration (VI) algorithm that solves a linear programming (LP) optimization at each iteration, and 3) an iterative policy iteration (PI) algorithm that solves a convex optimization at each iteration and guarantees the stability of the consecutive control policies. Convergence of the exact optimization problems, which are infinite-dimensional in all three cases, to the optimal risk-averse value function is shown. To turn these optimization problems into standard optimization problems with finite decision variables and constraints, function approximation for value estimations as well as constraint sampling are leveraged. Data-driven implementations of these algorithms are provided based on Q-function which enables learning the optimal value without any knowledge of the system dynamics. The performance of the approximated solutions is also verified through a weighted sup-norm bound and the Lyapunov bound. A simulation example is provided to verify the effectiveness of the presented approach.

연구 동기 및 목표

  • 성능 기밀 시스템에서 존재하는 난수적 불확실성으로 인한 분산을 忽시하는 표준 강화 학습의 한계를 해결하기 위해.
  • 시스템 동역학 모델이 필요 없이 기대 비용과 그 분산을 동시에 최적화하는 모델 프리, 데이터 기반 강화 학습 알고리즘을 개발하기 위해.
  • 축합 최적화 기법을 활용하여 위험 회피 제어 환경에서 학습된 정책의 안정성과 수렴성을 보장하기 위해.
  • 실제 구현에서 함수 근사와 제약 조건 샘플링에 대한 이론적 오차 한계를 제공하기 위해.
  • 온라인 상호작용 없이 사전에 수집된 데이터셋에서 학습 가능하게 하여 자율 시스템의 실세계 구현을 지원하기 위해.

제안 방법

  • 기대 비용과 그 분산을 동시에 최소화하는 엔트로피 리스크 측정을 사용하여 위험 회피 최적 제어 문제를 수식화한다.
  • 사전 데이터에서 샘플된 제약 조건을 사용하여 무한차원 최적화 문제를 근사하는 일괄적 정적 축합 프로그램을 개발한다.
  • 각 단계에서 선형 프로그램을 해결하는 반복적 값 반복 알고리즘을 제안하며, 이는 위험 회피 가치 함수로의 수렴을 보장한다.
  • 각 반복에서 축합 최적화 문제를 해결하는 정책 반복 알고리즘을 도입하며, 연속된 제어 정책의 안정성을 보장한다.
  • 값 함수 추정의 차원을 줄이기 위해 푸리에 기저 함수를 통한 함수 근사를 적용한다.
  • 무한차원 축합 프로그램을 유한차원 표준 축합 최적화 문제로 변환하기 위해 제약 조건 샘플링을 사용한다.

실험 결과

연구 질문

  • RQ1시스템 동역학 모델을 알지 못해도 위험 회피 최적 제어 문제를 해결할 수 있는 모델 프리, 데이터 기반 강화 학습 알고리즘을 설계할 수 있는가?
  • RQ2어떻게 축합 프로그래밍을 활용하여 비선형 시스템의 위험 회피 강화 학습에서 수렴성과 안정성을 보장할 수 있는가?
  • RQ3함수 근사와 제약 조건 샘플링이 학습된 위험 회피 정책의 정확성에 미치는 영향은 무엇인가?
  • RQ4성능 분산과 내성성 측면에서 제안된 방법은 위험 중립적 강화 학습에 비해 어떻게 비교되는가?
  • RQ5온라인 탐색 없이 사전에 수집된 데이터셋을 효과적으로 활용하여 안정적이고 분산이 낮은 제어 정책을 학습시킬 수 있는가?

주요 결과

  • 제안된 일괄적 축합 프로그램 기반 강화 학습은 충분한 수의 샘플된 제약 조건이 있을 경우 최적의 위험 회피 가치 함수로 수렴함을 보였다. N = 1e7 개의 샘플에서 성능이 최적 해에 수렴함을 확인하였다.
  • 시뮬레이션 결과는 위험 회피 케이스(α = 5)가 위험 중립 케이스에 비해 훨씬 낮은 성능 분산을 보이며, 그림 3에서 더욱 날렵한 상태 궤적을 통해 이를 입증한다.
  • N ≥ 9e⁴개의 샘플된 제약 조건에서 근사 오차가 최소화되고, 해 추정치의 분산이 상당히 감소함을 확인하여 제약 조건 샘플링의 효과를 입증한다.
  • 값 반복 및 정책 반복 알고리즘이 최적 해로 수렴하며, 정책 반복 버전은 학습된 제어 정책의 안정성을 보장한다.
  • 함수 근사 및 제약 조건 샘플링에 대한 이론적 오차 한계가 확립되어 근사 품질에 대한 엄밀한 기반을 제공한다.
  • 비볼록 최적화를 피하고 하이퍼파rameter 조정에 대한 민감도를 감소시킴으로써 기존 방법보다 뛰어난 성능을 보이며, 정책 기반 강화 학습 대비 뚜렷한 우월성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.