Skip to main content
QUICK REVIEW

[논문 리뷰] Regret-optimal control in dynamic environments

Gautam Goel, Babak Hassibi|arXiv (Cornell University)|2020. 10. 20.
Advanced Bandit Algorithms Research참고 문헌 40인용 수 9
한 줄 요약

이 논문은 칼만 필터링과 후행 리카티 재귀를 포함한 행렬 분해를 위한 인과적 상태공간 표현을 유도하여, 상태 및 측정 과정이 노이즈를 포함하는 동적 시스템에 대한 위험 최적 제어 프레임워크를 개발한다. 주요 기여는 모델 불확실성 하에서 최적 제어 설계 및 시간 변화 시스템에서의 위험 최소화를 가능하게 하는 인과적 분해를 구축하는 방법으로, 형태 $\gamma^2I + G^{\top}(I + FF^{\top})^{-1}G = \Delta^{\top}\Delta$를 갖는다.

ABSTRACT

We consider control in linear time-varying dynamical systems from the perspective of regret minimization. Unlike most prior work in this area, we focus on the problem of designing an online controller which minimizes regret against the best dynamic sequence of control actions selected in hindsight (dynamic regret), instead of the best fixed controller in some specific class of controllers (static regret). This formulation is attractive when the environment changes over time and no single controller achieves good performance over the entire time horizon. We derive the state-space structure of the regret-optimal controller via a novel reduction to $H_{\infty}$ control and present a tight data-dependent bound on its regret in terms of the energy of the disturbance. Our results easily extend to the model-predictive setting where the controller can anticipate future disturbances and to settings where the controller only affects the system dynamics after a fixed delay. We present numerical experiments which show that our regret-optimal controller interpolates between the performance of the $H_2$-optimal and $H_{\infty}$-optimal controllers across stochastic and adversarial environments.

연구 동기 및 목표

  • 모델 불확실성 하에서 시간 변화하는 동적 시스템에 대한 위험 최적 제어 전략을 개발하기 위해.
  • 표현 $\gamma^2I + G^{\top}(I + FF^{\top})^{-1}G$ 를 인과적 $\Delta^{\top}\Delta$ 형태로 분해하여 최적 제어 합성에 활용하기 위해.
  • 전진 및 후행 칼만 필터링 재귀를 사용하여 $L$, $L^{-1}$, $L^{-1}G$, 및 $\Delta$ 의 상태공간 모델을 유도하기 위해.
  • 재귀적 행렬 분해와 리카티 방정식을 통해 유도된 제어 법칙의 인과성과 안정성을 확보하기 위해.

제안 방법

  • 시스템 동역학 $\xi_{t+1} = A_t\xi_t + B_{u,t}u_t$ 와 $y_t = Q_t^{1/2}\xi_t + v_t$ 를 바탕으로, 상태 추정치 $\hat{\xi}_t$ 와 잔차 $e_t$ 를 사용하여 $L$ 의 전진 상태공간 모델을 유도한다.
  • 노이즈가 $\mathcal{N}(0, I)$ 인 $e \sim \mathcal{N}(0, I)$ 인 $y = Le$ 를 모델링하여, $I + FF^{\top} = LL^{\top}$ 의 인과적 분해를 구성함으로써 공분산 매칭을 가능하게 한다.
  • 후행 시간 칼만 필터링을 사용하여 $\Delta^{\top}$ 의 상태공간 모델을 유도한다. 여기서 $\nu_t$ 는 $\nu_{t-1} = \tilde{A}_t^\top \nu_t + Q_t^{1/2}R_{e,t}^{-1/2}a_t$ 를 통해 진화하고, $z_t = B_{w,t}^\top \nu_t + b_t$ 를 만족한다.
  • 후행 리카티 재귀를 유도하여 $P_t^b$ 를 계산하며, $P_{T}^b = 0$ 이고, 후행 필터의 칼만 이득 $K_{l,t}^b$ 를 계산할 수 있도록 한다.
  • 차이 $\nu_t = \eta_t - \hat{\xi}_t$ 를 사용하여 $L^{-1}G$ 의 최소 상태공간 모델을 구성한다. 이로 인해 $\nu_{t+1} = \tilde{A}_t \nu_t + B_{w,t}w_t$, $e_t = R_{e,t}^{-1/2}Q_t^{1/2}\nu_t$ 를 얻으며, 여기서 $\tilde{A}_t = A_t - K_{p,t}Q_t^{1/2}$ 이다.
  • 후행 필터를 통해 $\Delta^{-1}$ 을 유도한다. $\hat{\nu}_{t+1} = (\tilde{A}_t - B_{w,t}(K_{l,t}^b)^\top)\hat{\nu}_t + B_{w,t}(R_{e,t}^b)^{-1/2}z_t$ 와 $f_t = -(K_{l,t}^b)^\top\hat{\nu}_t + (R_{e,t}^b)^{-1/2}z_t$ 를 통해 인과적 역행렬을 보장한다.

실험 결과

연구 질문

  • RQ1위험 최적 제어 문제는 노이즈가 있는 공분산 행렬의 역행렬을 포함하는 행렬 분해로 어떻게 공식화될 수 있는가?
  • RQ2어떤 인과적 상태공간 표현이 $\gamma^2I + G^{\top}(I + FF^{\top})^{-1}G = \Delta^{\top}\Delta$ 를 만족하는 $\Delta$ 를 구성하는 데 도움이 되는가?
  • RQ3후행 시간 칼만 필터링을 사용하여 제어 합성에 활용할 수 있는 $\Delta$ 의 인과적 역행렬을 어떻게 도출할 수 있는가?
  • RQ4어떤 재귀적 행렬 방정식이 $L$, $L^{-1}G$, 및 $\Delta$ 의 유도된 상태공간 모델에서 안정성과 인과성을 보장하는가?
  • RQ5전진 및 후행 필터링 간의 상호작용을 어떻게 활용하여 최적 제어 법칙의 최소 및 인과적 표현을 구성할 수 있는가?

주요 결과

  • 논문은 전진 칼만 필터링을 사용하여 $I + FF^{\top} = LL^{\top}$ 의 인과적 분해를 성공적으로 구성하였으며, 이는 상태 추정치 $\hat{\xi}_t$ 와 잔차 $e_t$ 에 기반한다.
  • 최소 차수의 상태공간 모델 $L^{-1}G$ 는 $\nu_{t+1} = \tilde{A}_t \nu_t + B_{w,t}w_t$, $e_t = R_{e,t}^{-1/2}Q_t^{1/2}\nu_t$ 를 통해 유도되었으며, 여기서 $\tilde{A}_t = A_t - K_{p,t}Q_t^{1/2}$ 이다. 이는 인과성과 최소 차수를 보장한다.
  • 후행 리카티 재귀는 $P_T^b = 0$ 으로 유도되었으며, 이는 후행 필터에 사용되는 칼만 이득 $K_{l,t}^b$ 를 계산할 수 있도록 한다.
  • 후행 필터를 통해 $\Delta$ 의 인과적 상태공간 모델을 확보하였으며, $\hat{\nu}_{t+1} = \tilde{A}_t \hat{\nu}_t + B_{w,t}f_t$, $z_t = (R_{e,t}^b)^{1/2}(K_{l,t}^b)^\top \hat{\nu}_t + (R_{e,t}^b)^{1/2}f_t$ 를 통해 $\Delta^\top\Delta = \gamma^2I + G^{\top}(I + FF^{\top})^{-1}G$ 를 보장한다.
  • $\Delta^{-1}$ 은 후행 필터를 통해 구성되었으며, $\hat{\nu}_{t+1} = (\tilde{A}_t - B_{w,t}(K_{l,t}^b)^\top)\hat{\nu}_t + B_{w,t}(R_{e,t}^b)^{-1/2}z_t$, $f_t = -(K_{l,t}^b)^\top\hat{\nu}_t + (R_{e,t}^b)^{-1/2}z_t$ 를 통해 인과적 역행렬이 보장된다.
  • $G\Delta^{-1}$ 의 전체 시스템 모델은 $\Delta^{-1}$ 과 $G$ 의 상태공간 모델을 조합하여 유도되었으며, $\zeta_t = \eta_t + \psi_t$ 를 통해 전체 제어 법칙 합성을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.