Skip to main content
QUICK REVIEW

[논문 리뷰] Randomized Optimal Stopping Problem in Continuous time and Reinforcement Learning Algorithm

Yuchao Dong|arXiv (Cornell University)|2022. 08. 04.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 보상 기능에 엔트로피 정규화를 통합하여 연속 시간에서 랜덤화된 최적 정지 프레임워크를 제안한다. 이는 문제를 해결 가능한 HJB 방정식으로 변환하며, 정책 반복의 수렴 속도를 확립하고, 온도 매개변수 λ가 학습 속도와 편향 사이의 균형을 맞춘다는 것을 보여준다. 수치 결과는 특화된 강화학습 알고리즘을 사용하여 아메리칸 풋 옵션에 대해 이 접근 방식을 검증한다.

ABSTRACT

In this paper, we study the optimal stopping problem in the so-called exploratory framework, in which the agent takes actions randomly conditioning on current state and an entropy-regularized term is added to the reward functional. Such a transformation reduces the optimal stopping problem to a standard optimal control problem. We derive the related HJB equation and prove its solvability. Furthermore, we give a convergence rate of policy iteration and the comparison to classical optimal stopping problem. Based on the theoretical analysis, a reinforcement learning algorithm is designed and numerical results are demonstrated for several models.

연구 동기 및 목표

  • 강화학습의 탐색적 프레임워크를 연속 시간 최적 정지 문제로 확장하기 위해.
  • 엔트로피 정규화를 사용하여 최적 정지 문제를 정규화된 최적 제어 문제로 재구성하기 위해.
  • 아메리칸 풋 옵션에 대해 관련된 해밀토니안-자코비-벨만(HJB) 방정식의 해 존재성을 도출하고 증명하기 위해.
  • 온도 매개변수 λ의 선택이 수렴 속도와 편향 사이의 트레이드오프에 미치는 영향을 분석하기 위해.
  • 이론적 통찰을 바탕으로 한 강화학습 알고리즘을 설계하고 검증하며, 금융 모델에 대한 수치 실험을 수행하기 위해.

제안 방법

  • 값 추정에 기반한 온도 조정된 소프트맥스를 통한 확률적 행동 선택을 기반으로 한 랜덤화된 정책 프레임워크를 도입한다.
  • 정책의 미분 엔트로피 비례 정규화 항을 보상 기능에 추가하여 탐색을 촉진한다.
  • 이 탐색적 설정 하에서 값 함수에 대한 HJB 방정식을 유도하며, 점성 해 이론과 샤우더 추정을 통해 그 해의 존재성을 증명한다.
  • 정규화된 값 함수와 고전적 최적 값 함수 간의 차이에 대한 경계를 설정하여, 이가 O(λ log(1/λ)) 스케일링을 따른다는 것을 보여준다.
  • 적절한 조건 하에서 선형 수렴을 보이는 수렴 속도 분석을 포함한 정책 반복 알고리즘을 설계한다.
  • 신경망을 사용하여 값 함수와 정책을 근사하고, 미분 가능성을 보장하기 위해 소프트 정지 규칙을 적용한 강화학습 알고리즘을 구현한다.
Figure 1 : Value functions $u^{\lambda}$ and $u^{*}$ at $t=0$
Figure 1 : Value functions $u^{\lambda}$ and $u^{*}$ at $t=0$

실험 결과

연구 질문

  • RQ1연속 시간 강화학습의 탐색적 프레임워크는 어떻게 연속 시간 최적 정지 문제에 적응될 수 있는가?
  • RQ2온도 매개변수 λ는 해의 수렴 속도와 편향 사이의 트레이드오프에 어떤 영향을 미치는가?
  • RQ3정규화된 최적 정지 문제에 대해 유도된 HJB 방정식은 고전적 해를 갖는다 할 수 있는가?
  • RQ4정규화된 값 함수 V^λ와 고전적 최적 값 함수 V* 간의 근사 오차 관계는 어떠한가?
  • RQ5이 랜덤화된 최적 정지 설정에서 정책 반복 알고리즘의 수렴 속도는 어떠한가?

주요 결과

  • 정규화된 최적 정지 문제에 대한 HJB 방정식은 고전적 해를 갖는다. 국소 샤우더 추정을 통해 연속적인 도함수를 확립한다.
  • 정규화된 값 함수 V^λ와 고전적 최적 값 함수 V* 간의 차이는 O(λ log(1/λ))로 경계지며, 이는 통제 가능한 편향임을 나타낸다.
  • 정책 반복 알고리즘은 선형 수렴을 보이며, 수렴 속도는 온도 매개변수 λ의 선택에 따라 달라진다.
  • 수치 결과는 λ를 증가시킬수록 수렴 속도가 향상되지만 해의 편향이 증가함을 보여주며, 이는 트레이드오프를 확인한다.
  • 제안된 강화학습 알고리즘은 아메리칸 풋 옵션에 대한 최적 정지 전략을 성공적으로 학습하였으며, 소프트 정지 규칙이 기울기 기반 최적화를 가능하게 하였다.
  • 기대 할인 수익 손실에 대한 이론적 경계는 약 O(λ log(1/λ))이며, 이는 랜덤화된 정책을 사용할 경우 발생하는 자산 비용을 정량화한다.
(a) $\{u^{\lambda}>h\}$
(a) $\{u^{\lambda}>h\}$

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.