Skip to main content
QUICK REVIEW

[논문 리뷰] Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds Globally Optimal Policy

Han Zhong, Deng, Xun|arXiv (Cornell University)|2020. 12. 28.
Reinforcement Learning in Robotics참고 문헌 61인용 수 5
한 줄 요약

이 논문은 평균 보상 설정 하에서 위험 감수성 있는 딥 강화 학습을 위한 분산 제약이 있는 액터-크리틱 알고리즘인 VARAC을 제안한다. 라그랑주 및 펜첼 쌍대성의 활용을 통해 제약 최적화 문제를 안장점 문제로 변환함으로써, 과다 파rameter화된 신경망을 사용할 경우 하위선형 수렴 속도 O(1/√K)로 전역 최적 정책으로 증명 가능한 수렴을 가능하게 한다.

ABSTRACT

While deep reinforcement learning has achieved tremendous successes in various applications, most existing works only focus on maximizing the expected value of total return and thus ignore its inherent stochasticity. Such stochasticity is also known as the aleatoric uncertainty and is closely related to the notion of risk. In this work, we make the first attempt to study risk-sensitive deep reinforcement learning under the average reward setting with the variance risk criteria. In particular, we focus on a variance-constrained policy optimization problem where the goal is to find a policy that maximizes the expected value of the long-run average reward, subject to a constraint that the long-run variance of the average reward is upper bounded by a threshold. Utilizing Lagrangian and Fenchel dualities, we transform the original problem into an unconstrained saddle-point policy optimization problem, and propose an actor-critic algorithm that iteratively and efficiently updates the policy, the Lagrange multiplier, and the Fenchel dual variable. When both the value and policy functions are represented by multi-layer overparameterized neural networks, we prove that our actor-critic algorithm generates a sequence of policies that finds a globally optimal policy at a sublinear rate. Further, We provide numerical studies of the proposed method using two real datasets to back up the theoretical results.

연구 동기 및 목표

  • 특히 분산 제약 목표 하에서 이론적 보장이 부족한 위험 감수성 딥 강화 학습의 문제를 해결한다.
  • 장기 평균 보상의 기대값을 최대화하면서 수익의 분산을 제약하는 분산 제약 정책 최적화 문제를 수립한다.
  • 비볼록성과 과다 파arameter화에도 불구하고 전역 최적 정책을 증명 가능하게 찾는 이론적으로 탄탄한 알고리즘을 개발한다.
  • 결과 안정성이 핵심인 포트폴리오 관리 및 로봇 공학과 같은 위험 감수성 도메인으로 딥 강화 학습의 적용 가능성을 확장한다.
  • 라그랑주 완화와 펜첼 쌍대성을 통합하여 딥 정책 학습에서 분산 제약를 다룰 수 있는 통합 프레임워크를 제공한다.

제안 방법

  • 분산 제약에 대해 라그랑주 쌍대성을 적용하여 분산 제약 최적화 문제를 제약 없는 안장점 문제로 변환한다.
  • 더 나아가 펜첼 쌍대성을 도입하여 문제를 이중 공간으로 재구성함으로써 정책 및 이중 변수 업데이트를 효율적으로 가능하게 한다.
  • 액터-크리틱 업데이트를 사용하여 정책, 라그랑주 승수, 펜첼 이중 변수를 반복적으로 갱신하는 VARAC 알고리즘을 설계한다.
  • 신경망을 사용해 이중 Q-값 함수를 근사하고, 수정된 보상 함수를 가진 변형된 MDP를 해결하기 위해 TD3를 기본 알고리즘으로 사용한다.
  • 안정적인 정책 향상을 보장하기 위해 KL 발산을 고려한 정규화된 정책 업데이트를 적용한다.
  • 이중 변수(λ 및 y)에 대해 시간 평균 업데이트 기법을 적용하여 수렴 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1장기 평균 보상에 대한 분산 제약 조건 하에서 딥 강화 학습 알고리즘이 전역 최적 정책을 증명 가능하게 찾을 수 있는가?
  • RQ2비볼록 목표 함수를 가진 분산 제약이 있는 딥 강화 학습 문제를 효과적으로 다루기 위해 라그랑주 및 펜첼 쌍대성을 어떻게 통합할 수 있는가?
  • RQ3과다 파arameter화된 신경망 함수 근사 하에서 제안된 알고리즘이 전역 최적 정책으로 향하는 수렴 속도는 어떠한가?
  • RQ4기대 수익과 분산 제어 측면에서 위험 중립 기반 알고리즘 대비 실용적 성능은 어떠한가?
  • RQ5제안된 방법은 포트폴리오 관리 및 로봇 제어와 같은 실세계 위험 감수성 제어 과제에 적용 가능한가?

주요 결과

  • VARAC 알고리즘은 안장점으로의 전역 수렴 속도가 O(1/√K)이며, 이는 동일한 속도로 전역 최적 정책으로 수렴함을 보여준다.
  • Pendulum-v0 및 BipedalWalkerHardcore-v3에서의 실험 결과, VARAC는 TD3 대비 각각 30%와 34%의 성능 분산 감소를 달성했으며, 평균 수익은 유사하게 유지된다.
  • Pendulum-v0에서는 VARAC가 분산 4,826을 기록한 반면 TD3는 6,903을 기록했고, BipedalWalkerHardcore-v3에서는 분산이 9,348에서 6,090으로 감소했다.
  • 느린 수렴에도 불구하고, 10개의 랜덤 시드 전반에서 VARAC는 일관되게 낮은 분산을 기록하여 위험 감수성 설정에서의 효과성을 입증한다.
  • 알고리즘은 기대 수익과 분산을 효과적으로 균형 잡아, 로봇 공학 및 금융 분야와 같은 안전이 핵심인 애플리케이션에 적합하다.
  • 실세계 제어 환경을 활용한 수치 실험을 통해 이론적 프레임워크가 검증되었으며, 이는 접근법의 강건성과 실용적 유용성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.