Skip to main content
QUICK REVIEW

[논문 리뷰] Black-Box Control for Linear Dynamical Systems

Xinyi Chen, Elad Hazan|arXiv (Cornell University)|2020. 07. 13.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 16
한 줄 요약

이 논문은 적대적 방해와 볼록 비용 함수 하에서 단일 궤적에서 하위선형 재해를 갖는 알 수 없는 선형 시간 불변(LTI) 시스템에 대한 첫 번째 효율적인 블랙박스 제어 알고리즘을 제안한다. 일반적인 볼록 비용 함수에 대해 $2^{\tilde{O}({\mathcal{L}})} + \tilde{O}(\mathrm{poly}({\mathcal{L}})T^{2/3})$의 재해 경계를 달성하고, 제곱 비용 함수에 대해서는 $2^{\tilde{O}({\mathcal{L}})} + \tilde{O}(\mathrm{poly}({\mathcal{L}})\sqrt{T})$의 재해 경계를 달성한다. 또한, 시스템 크기 $\mathcal{L}$에 대한 지수적 의존성이 불가피함을 $2^{\Omega(\mathcal{L})}$의 하한을 통해 증명한다.

ABSTRACT

We consider the problem of controlling an unknown linear time-invariant dynamical system from a single chain of black-box interactions, with no access to resets or offline simulation. Under the assumption that the system is controllable, we give the first efficient algorithm that is capable of attaining sublinear regret in a single trajectory under the setting of online nonstochastic control. This resolves an open problem on the stochastic LQR problem, and in a more challenging setting that allows for adversarial perturbations and adversarially chosen and changing convex loss functions. We give finite-time regret bounds for our algorithm on the order of $2^{ ilde{O}(\mathcal{L})} + ilde{O}( ext{poly}(\mathcal{L}) T^{2/3})$ for general nonstochastic control, and $2^{ ilde{O}(\mathcal{L})} + ilde{O}( ext{poly}(\mathcal{L}) \sqrt{T})$ for black-box LQR, where $\mathcal{L}$ is the system size which is an upper bound on the dimension. The crucial step is a new system identification method that is robust to adversarial noise, but incurs exponential cost. To complete the picture, we investigate the complexity of the online black-box control problem, and give a matching lower bound of $2^{Ω(\mathcal{L})}$ on the regret, showing that the additional exponential cost is inevitable. This lower bound holds even in the noiseless setting, and applies to any, randomized or deterministic, black-box control method.

연구 동기 및 목표

  • 리셋 또는 오프라인 시뮬레이션에 접근할 수 없는 알 수 없는 LTI 시스템에 대한 효율적인 블랙박스 제어 문제를 해결하기 위해.
  • 적대적 방해와 변화하는 볼록 비용 함수 하에서 단일 온라인 궤적에서 하위선형 재해를 달성하는 알고리즘을 개발하기 위해.
  • 시스템 동역학에 대한 사전 지식이 없음에도 불구하고, 과거에서 가장 좋은 제어기와의 경쟁 가능한 유한 시간 재해 경계를 확립하기 위해.
  • 모든 결정적 또는 확률적 블랙박스 제어 방법에 대해 시스템 크기 $\mathcal{L}$에 대한 지수적 의존성이 불가피함을 증명하기 위해.

제안 방법

  • 적대적 노이즈에 강건한 새로운 시스템 식별 방법을 제안하여 단일 궤적에서 시스템 동역학을 정확하게 추정할 수 있도록 한다.
  • 상태 크기를 지수적으로 증가시키는 오р토곤럴 행렬 $V$와 제어 이득 $Q$의 반복적 구성 방법을 사용하여 시스템의 관측 가능성과 가용성을 보장한다.
  • H_2, $H_\infty$, 최적 선형 제어기 등을 포함하는 분노행동 제어 정책 클래스를 비교 정책으로 사용한다.
  • 과거 상태와 비용에 기반하여 행동을 적응적으로 선택하는 제어 정책을 도입하며, 정책 공간에서 투영된 온라인 경사 하강법을 활용한다.
  • 상태 노름의 지수적 증가를 활용하여 식별 가능성 보장을 통해 추정 오차와 제어 성능의 새로운 분석을 통해 재해 경계를 유도한다.
  • 재해에 대한 정보 이론적 하한 $2^{\Omega(\mathcal{L})}$를 확립하여, 어떤 결정적 또는 확률적 블랙박스 방법이라도 지수적 비용을 피할 수 없음을 증명한다.

실험 결과

연구 질문

  • RQ1단일 블랙박스 액세스와 리셋이 없는 조건에서, 효율적인 알고리즘이 알 수 없는 LTI 시스템의 온라인 비스택스틱 제어에서 하위선형 재해를 달성할 수 있는가?
  • RQ2단일 궤적만을 사용하여 적대적 방해 하에서 시스템 동역학을 강건하게 식별할 수 있는가?
  • RQ3시스템 크기 $\mathcal{L}$에 따른 블랙박스 제어의 본질적 복잡도는 무엇이며, $\mathcal{L}$에 대한 지수적 의존성은 피할 수 있는가?
  • RQ4제안된 알고리즘이 과거에서 가장 좋은 분노행동 제어기와의 경쟁 가능한 재해 경계를 달성하는가?
  • RQ5블랙박스 제어의 지수적 비용이 본질적이고 피할 수 없음을 증명하는 날카운 하한을 확립할 수 있는가?

주요 결과

  • 제안된 알고리즘은 일반적인 볼록 비용 함수에 대해 $\tilde{O}(\mathrm{poly}(\mathcal{L})T^{2/3})$의 재해를 달성하며, 시스템 식별으로 인해 추가로 $2^{\tilde{O}(\mathcal{L})}$의 항이 존재한다.
  • 제곱 비용 함수의 특수한 경우(블랙박스 LQR)에서는 재해 경계가 $2^{\tilde{O}(\mathcal{L})} + \tilde{O}(\mathrm{poly}(\mathcal{L})\sqrt{T})$로 향상되며, 이는 스토케스틱 설정에서 알려진 최고의 경계와 일치한다.
  • 알고리즘은 효율적이며 다항 시간 내에 실행되며, LTI 시스템에 대한 효율적 블랙박스 제어 문제를 해결한다.
  • 비스택스틱 설정에서 재해에 대한 매칭되는 하한 $2^{\Omega(\mathcal{L})}$이 증명되어, 시스템 크기 $\mathcal{L}$에 대한 지수적 의존성이 불가피함을 보여준다.
  • 이 하한은 노이즈가 없는 경우에도 성립하며, 모든 결정적 및 확률적 블랙박스 제어 방법에 적용되며 문제의 본질적 한계를 확립한다.
  • 시스템 식별 방법은 적대적 노이즈에 강건하며, 단일 궤적에서 식별 가능성을 보장하기 위해 노름이 지수적으로 증가하는 상태 궤적을 구성하는 데 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.