Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic control up to a hitting time: optimality and rolling-horizon implementation

Debasish Chatterjee, Eugenio Cinquemani|ArXiv.org|2008. 06. 18.
Advanced Control Systems Optimization참고 문헌 32인용 수 6
한 줄 요약

이 논문은 비가역적이지 않은 컴acts한 목표 집합으로의 도달 시간까지의 확률적 최적 제어를 위한 동적 프로그래밍 접근법을 개발한다. 수축 사상에 기반한 최적 정책의 존재성과 유일성을 증명하고, 양의 하향성 하한을 갖는 롤링 하이즌 근사법을 제안하며, 비용과 상태 동역학의 온건한 성장 조건 하에서 값 반복의 渐진적 할인 최적성( asymptotic discount-optimality )을 증명한다.

ABSTRACT

We present a dynamic programming-based solution to a stochastic optimal control problem up to a hitting time for a discrete-time Markov control process. Firstly, we determine an optimal control policy to steer the process toward a compact target set while simultaneously minimizing an expected discounted cost. We then provide a rolling-horizon strategy for approximating the optimal policy, together with quantitative characterization of its sub-optimality with respect to the optimal policy. Finally, we address related issues of asymptotic discount-optimality of the value-iteration policy. Both the state and action spaces are assumed to be Polish.

연구 동기 및 목표

  • 비유계 노이즈와 경계 조건이 있는 시스템에서 확률적 모델 예측 제어(MPC)의 이론적 기반 부족 문제를 해결한다.
  • 비가역적이지 않은 컴acts한 목표 집합으로의 도달 시간까지의 마르코프 과정에 대한 최적 제어 프레임워크를 개발한다.
  • 최적 정책에 대한 정량적 성능 보장을 갖는 롤링 하이즌 실행 전략을 제공한다.
  • 비용과 상태 동역학의 온건한 성장률 조건 하에서 값 반복의 渐진적 할인 최적성( asymptotic discount-optimality )을 확립한다.
  • 경계 조건을 확률적 조건으로 완화하면서도 최적 제어 정책에 의해 신속한 복구를 보장함으로써 실용적인 MPC 설계를 가능하게 한다.

제안 방법

  • 이산 시간 마르코프 제어 과정에서 상태가 폴리쉬 공간 상의 컴acts한 목표 집합에 도달할 때까지의 기대 할인 비용을 최소화하는 문제로 문제를 수립한다.
  • 표준적인 온건한 가정 하에서 값 함수에 대한 벨먼 방정식을 유도하고, 결정적 정적 최적 정책의 존재성을 증명한다.
  • 비용과 상태 동역학의 성장률 조건 하에서 수축 사상 원리를 적용하여 최적 값 함수의 존재성과 유일성을 확립한다.
  • 각 단계에서 길이 $N$의 후행 하이즌을 사용하는 유한 시간 최적 제어 문제를 푸는 롤링 하이즌 정책을 제안한다.
  • 할인 요소 $\alpha$, 성장률 $\gamma < 1$, 그리고 리아파노프 유사 함수 $w(x)$를 포함한 상한을 통해 롤링 하이즌 정책의 비최적성 정도를 정량화한다.
  • 테일러링 시리즈와 조건부 기대값 추론을 사용하여 롤링 하이즌 정책과 최적 정책 간의 기대 비용 차이에 대한 상한을 유도한다.

실험 결과

연구 질문

  • RQ1목표 집합이 비가역적이지 않은 경우에도 도달 시간까지의 확률적 제어에 대해 최적 정책을 보장할 수 있는가?
  • RQ2최적 정책에 대한 상대적인 유한 비최적성 보장을 확보하기 위해 롤링 하이즌 근사법을 어떻게 설계할 수 있는가?
  • RQ3비용과 상태 동역학에 어떤 조건이 성립해야 값 반복의 수렴성과 안정성이 보장되는가?
  • RQ4비가역적이지 않은 목표 집합에 대한 롤링 하이즌 MPC 프레임워크에서 성능와 계산 복잡도의 상호 간의 트레이드오프를 어떻게 정량화할 수 있는가?
  • RQ5도달 시간 제어 맥락에서 값 반복 정책이 어떤 조건 하에서 渐진적 할인 최적성( asymptotic discount-optimality )을 갖는가?

주요 결과

  • 목표 집합이 비가역적이어도 도달 시간까지의 확률적 제어 문제에 대해 최적의 결정적 정적 정책이 존재한다.
  • 최적 값 함수는 목표 집합의 비가역성 특성을 반영하기 위해 상태 공간의 부분집합에 대한 통합을 포함하는 벨먼 방정식을 만족한다.
  • 비용과 상태 동역학에 대한 온건한 성장률 조건 하에서 최적 값 함수는 유일하며, 값 반복을 통해 도출될 수 있다.
  • 롤링 하이즌 정책의 비최적성 간격은 $\frac{\overline{c}\gamma^{N+1}}{1-\gamma}w(x)$로 유계되며, 여기서 $\overline{c}$는 비용 상한, $\gamma < 1$는 성장률, $w(x)$는 리아파노프 유사 함수이다.
  • 값 반복 정책은 渐진적 할인 최적성( asymptotic discount-optimality )을 갖는다. 즉, 할인 요소 $\alpha \to 1$일 때 성능이 최적 정책에 수렴한다.
  • 이론적 프레임워크는 확률적 제약 조건과 제약 위반 후 신속한 안전 집합 복귀 전략을 보장하는 최적 제어 정책을 통해 실용적인 MPC 설계를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.