[논문 리뷰] Regularity and stability of feedback relaxed controls
이 논문은 다차원 확률적 퇴출 시간 문제를 위한 강건한 피드백 제어를 구축하기 위해 탐색 보상과 함께 유연한 제어 정규화를 도입한다. 최적 피드백 제어의 허더 연속성을 확립하고, 모델 매개변수 변화에 대한 가치 함수와 제어의 리프시츠 안정성을 증명함으로써, 탐색 기반 강화 학습 히우리즘에 대한 이론적 기반을 제공한다.
This paper proposes a relaxed control regularization with general exploration rewards to design robust feedback controls for multi-dimensional continuous-time stochastic exit time problems. We establish that the regularized control problem admits a Hölder continuous feedback control, and demonstrate that both the value function and the feedback control of the regularized control problem are Lipschitz stable with respect to parameter perturbations. Moreover, we show that a pre-computed feedback relaxed control has a robust performance in a perturbed system, and derive a first-order sensitivity equation for both the value function and optimal feedback relaxed control. These stability results provide a theoretical justification for recent reinforcement learning heuristics that including an exploration reward in the optimization objective leads to more robust decision making. We finally prove first-order monotone convergence of the value functions for relaxed control problems with vanishing exploration parameters, which subsequently enables us to construct the pure exploitation strategy of the original control problem based on the feedback relaxed controls.
연구 동기 및 목표
- 모델 매개변수 변화와 이산적인 argmax 매핑으로 인한 피드백 제어의 불안정성 문제를 해결하기 위해.
- 연속 시간 다차원 시스템에서 탐색 보상으로 정규화된 제어 프레임워크를 개발하여 강건성을 향상시키기 위해.
- 모델 불확실성 하에서 정규화된 피드백 제어와 가치 함수의 이론적 안정성 및 수렴 성질을 확립하기 위해.
- 엄밀한 민감도 및 수렴 분석을 통해 탐색 기반 강화 학습 히우리즘을 정당화하기 위해.
제안 방법
- 해밀턴-자코비-벨리만(HJB) 방정식에서 argmax 선택을 매끄럽게 하기 위해 일반적인 탐색 보상으로 구성된 이완 제어 정규화를 도입한다.
- 탐색 매개변수에 따라 변화하는 계수를 갖는 정규화된 HJB 편미분방정식을 분석하여 최적 피드백 제어의 허더 연속성을 확립한다.
- 모델 매개변수 변화에 대한 가치 함수와 최적 피드백 제어에 대한 일阶 민감도 방정식을 유도한다.
- 계수(b, σ, c, f)의 변화에 대한 가치 함수와 피드백 제어의 리프시츠 안정성을 증명한다.
- 홀더 공간에서의 보간 부등식과 사전 추정치를 활용하여 정규화된 HJB 방정식의 해의 정(regularity)을 근사한다.
- 탐색 매개변수가 0으로 수렴함에 따라 가치 함수의 단조 수렴을 시연함으로써, 이완 제어에서 순수 이용 전략을 구성할 수 있다.
실험 결과
연구 질문
- RQ1탐색 보상과 함께 정규화된 피드백 제어는 다차원 확률적 제어 문제에서 허더 연속성을 달성할 수 있는가?
- RQ2모델 계수(b, σ, c, f)의 미세한 변화에 대해 가치 함수와 피드백 제어는 어떻게 행동하는가?
- RQ3事前 계산된 피드백 이완 제어는 변화된 시스템에서도 강건한 성능을 유지를 할 수 있는가?
- RQ4가치 함수와 최적 제어의 일阶 민감도는 매개변수 변화에 대해 어떻게 되는가?
- RQ5탐색 매개변수가 0으로 수렴함에 따라 정규화된 가치 함수는 원래 제어 문제의 가치 함수로 단조 수렴하는가?
주요 결과
- 정규화된 문제의 최적 피드백 제어는 허더 연속성이 확보되어 있어 매끄럽고 구현 가능한 정책을 보장한다.
- 가치 함수와 피드백 제어는 모델 계수(b, σ, c, f)의 변화에 대해 리프시츠 안정성을 확보한다.
- 사전 계산된 피드백 이완 제어는 미세한 모델 편차가 있는 시스템에서도 강건한 성능을 유지한다.
- 가치 함수와 최적 피드백 제어에 대한 일阶 민감도 방정식이 유도되어 모델 불확실성의 기울기 기반 분석이 가능해진다.
- 탐색 매개변수가 0으로 수렴함에 따라 이완 제어 문제의 가치 함수는 원래 제어 문제의 가치 함수로 단조 수렴한다.
- 수렴 결과는 탐색을 점차 없애는 방식으로 이완 제어에서 순수 이용 전략을 구성할 수 있음을 허용한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.