Skip to main content
QUICK REVIEW

[논문 리뷰] The Nonstochastic Control Problem

Elad Hazan, Sham M. Kakade|arXiv (Cornell University)|2019. 11. 27.
Advanced Bandit Algorithms Research참고 문헌 26인용 수 9
한 줄 요약

이 논문은 적대적 교란과 볼록 손실 함수 하에서 미지의 선형 동적 시스템에 대한 비확률적 제어 문제를 제안하며, 후행적으로 가장 좋은 선형 정책에 대해 $O(T^{2/3})$의 손해를 달성하는 효율적인 알고리즘을 제시한다. 이 방법은 적대적 시스템 식별과 온라인 볼록 최적화를 결합하여 완전히 적대적인 교란 상황에서도 시스템 행렬을 복원하고 적응적으로 제어한다.

ABSTRACT

We consider the problem of controlling an unknown linear dynamical system in the presence of (nonstochastic) adversarial perturbations and adversarial convex loss functions. In contrast to classical control, the a priori determination of an optimal controller here is hindered by the latter's dependence on the yet unknown perturbations and costs. Instead, we measure regret against an optimal linear policy in hindsight, and give the first efficient algorithm that guarantees a sublinear regret bound, scaling as T^{2/3}, in this setting.

연구 동기 및 목표

  • 적대적이고 비확률적인 교란과 미지의 동역학을 가진 시스템에서의 강건한 제어 부족 문제를 해결하기 위해.
  • 후행적으로 가장 좋은 선형 정책에 대해 손해를 측정하는 새로운 제어 프레임워크—비확률적 제어를 정의하기 위해.
  • 시스템 행렬 $A$, $B$ 또는 교란 $w_t$에 대한 사전 지식이 없을 경우에도 하위선형 손해를 달성하는 효율적인 알고리즘을 개발하기 위해.
  • 이전에 표준 최소 제곱법으로는 구현이 불가능했던 적대적 노이즈 하에서의 시스템 식별 문제를 해결하기 위해.

제안 방법

  • 학습자가 온라인으로 제어 입력 $u_t$를 선택하여 후행적으로 가장 좋은 선형 정책에 대해 손해를 최소화하는 새로운 제어 프레임워크를 제안한다.
  • 적대적 교란 하에서 상태 경로로부터 시스템 행렬 $A$와 $B$를 복원하기 위해 적대적 시스템 식별 기법을 활용한다.
  • 안정성 확보와 모멘트 복원을 위해 제어 입력을 $u_t = -\mathbb{K}x_t + \eta_t$ 형태로 설정하며, $\eta_t$는 평균이 0인 랜덤 벡터이다.
  • 행렬 농도 부등식(Matrix Azuma)을 적용하여 관측된 상태-제어 쌍에서 $(A')^j B$의 모멘트를 추정한다.
  • 선형 시스템의 섭동 분석을 활용하여 추정된 모멘트 오차에 기반해 복원된 행렬 $\hat{A}, \hat{B}$의 오차를 한계화한다.
  • 추정된 시스템 동역학에 대해 온라인 볼록 최적화를 통합하여 하위선형 손해를 갖는 적응적 제어를 생성한다.

실험 결과

연구 질문

  • RQ1시스템 동역학과 교란이 모두 적대적인 상황에서, 미지의 선형 시스템 제어에서 하위선형 손해를 달성할 수 있는가?
  • RQ2독립적 동일분포 노이즈 가정 없이도 적대적 교란 하에서 시스템 행렬 $A$와 $B$를 정확히 식별할 수 있는가?
  • RQ3적대적 비용 함수와 미지의 동역학 하에서 후행적으로 가장 좋은 선형 정책과 경쟁할 수 있는 효율적 알고리즘을 설계할 수 있는가?
  • RQ4손해 한계가 시간 $T$에 대해 하위선형으로 스케일링되는가? 만약 그렇다면 최적의 비율은 무엇인가?

주요 결과

  • 제안된 알고리즘은 후행적으로 가장 좋은 선형 정책에 대해 $O(\textrm{poly}(\texttt{natural-parameters})T^{2/3})$의 손해를 달성하며, 이는 $T$에 대해 하위선형이다.
  • 시스템 식별은 $A^\prime = A - B\mathbb{K}$의 모멘트 복원을 통해 이루어지며, 오차 한계는 복원에 사용된 단계 수 $T_0$에 의존한다.
  • 복원된 $A^\prime$와 $B$는 $T_0 = O(kmn^2\kappa^{10}\gamma^{-2}W^2\varepsilon_{A,B}^{-2}\log(kmn\delta^{-1}))$일 때 고확률 $1-\delta$로 보장된다. 여기서 $\varepsilon_{A,B}$는 목표 오차이다.
  • 제어 정책 하에서 상태 노름과 제어 노름은 각각 $O(\kappa^3\gamma^{-1}W)$와 $O(\kappa^4\gamma^{-1}W)$로 유계이다.
  • 알고리즘은 각 시간 단계에서 최적 정책과의 비용 편차가 $O(Gn\kappa^8\gamma^{-2}W^2)$ 이내로 제한됨을 보장한다.
  • 손해 한계는 주된 항에서 시스템 차원에 독립적이며, 오직 $T^{2/3}$로 스케일링되며, 알려진 복잡도 한계 하에서는 최적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.