Skip to main content
QUICK REVIEW

[논문 리뷰] Improper Learning for Non-Stochastic Control

Max Simchowitz, Karan Singh|arXiv (Cornell University)|2020. 01. 25.
Advanced Control Systems Optimization참고 문헌 42인용 수 17
한 줄 요약

이 논문은 노이즈가 제거된 관측치를 사용하는 새로운 컨트롤러 파arametrization을 제안하고, 온라인 경사하강법을 적용하여 부분 관측 조건 하에서 비스스로적 제어에서 하위선형 재해를 달성한다. 알려진 시스템에 대해선 첫 번째 √T 재해 경계를 확립하고, 미지의 시스템에 대해선 T^{2/3}을 제시하며, 반반격적 노이즈 조건 하에서 최적의 다항로그 T 재해를 확보한다. 이는 모든 안정화 가능한 선형 컨트롤러와 경쟁한다.

ABSTRACT

We consider the problem of controlling a possibly unknown linear dynamical system with adversarial perturbations, adversarially chosen convex loss functions, and partially observed states, known as non-stochastic control. We introduce a controller parametrization based on the denoised observations, and prove that applying online gradient descent to this parametrization yields a new controller which attains sublinear regret vs. a large class of closed-loop policies. In the fully-adversarial setting, our controller attains an optimal regret bound of $\sqrt{T}$-when the system is known, and, when combined with an initial stage of least-squares estimation, $T^{2/3}$ when the system is unknown; both yield the first sublinear regret for the partially observed setting. Our bounds are the first in the non-stochastic control setting that compete with \emph{all} stabilizing linear dynamical controllers, not just state feedback. Moreover, in the presence of semi-adversarial noise containing both stochastic and adversarial components, our controller attains the optimal regret bounds of $\mathrm{poly}(\log T)$ when the system is known, and $\sqrt{T}$ when unknown. To our knowledge, this gives the first end-to-end $\sqrt{T}$ regret for online Linear Quadratic Gaussian controller, and applies in a more general setting with adversarial losses and semi-adversarial noise.

연구 동기 및 목표

  • 기존 최적의 컨트롤러를 사전 계산할 수 없는, 적대적인 동역학, 손실 함수, 부분 상태 관측 조건 하에서 비스스로적 제어 문제를 다루는 것.
  • 정적 피드백 정책이 아닌, 안정화 가능한 선형 동적 컨트롤러의 광범위한 클래스와 경쟁하는 재해 최소화 컨트롤러를 개발하는 것.
  • 비스스로적 제어 분야의 이전 결과들을 통합하고 향상시키며, 확률적 및 적대적 노이즈가 동시에 존재하는 설정으로 확장하는 것.
  • 모델이 알려지지 않은 상황에서도 고전적인 선형 제곱가우시안(LQG) 설정에서 엄밀한 재해 경계를 확보하는 것 — 이전 연구에서는 √T 재해 보장을 확보하지 못했다.

제안 방법

  • 유오라 파arametrization 기반의 컨트롤러 파arametrization을 제안하여, 시스템을 '자연의 y들' — 제어가 없는 상태에서의 관측치 — 로 재표현한다.
  • 노이즈 제거된 관측치에서 유도된 볼록 파arametrization인 교란 응답 제어(Disturbance Response Control, DRC) 프레임워크를 도입한다.
  • DRC 파arametrization에 온라인 경사하강법을 적용하여 경사하강법 기반의 응답 컨트롤러(DRC-GD)를 구성한다.
  • 두 단계 접근법을 사용: 미지의 시스템에 대해선 초기 최소 제곱 추정을 수행하고, 이후 DRC 공간에서 온라인 최적화를 수행한다.
  • 마팅게일 집중 및 서브가우시안 尾부 경계를 활용하여, 적대적 및 반반격적 노이즈 조건 하에서 고확률 재해 경계를 유도한다.
  • 손실 차이의 재귀적 분해와 경사 및 상태 추정 오차의 정교한 제어를 통해 재해 경계를 유도한다.

실험 결과

연구 질문

  • RQ1시스템 동역학이 알려지지 않은 상황에서 부분 관측 조건 하에서 비스스로적 제어에서 하위선형 재해를 달성할 수 있는가?
  • RQ2제안된 컨트롤러가 완전히 적대적 및 반반격적 노이즈 조건 하에서 최적의 재해 속도를 달성하는가?
  • RQ3재해 경계가 정적 피드백 정책이 아닌, 안정화 가능한 선형 동적 컨트롤러의 전체 클래스와 경쟁할 수 있는가?
  • RQ4부분 관측 조건 하에서 알려진 시스템에 대해 √T 재해 경계가 타당한가?
  • RQ5시스템이 알려진 경우 반반격적 노이즈 조건 하에서 다항로그 T 재해를 달성할 수 있는가?

주요 결과

  • DRC-GD 컨트롤러는 알려진 시스템에 대해 완전한 적대적 조건 하에서 Õ(√T) 재해를 달성하며, 이는 타당하고 부분 관측 조건 하에서 최초의 그러한 경계이다.
  • 미지의 시스템에 대해선 Õ(T^{2/3}) 재해를 달성하며, 이는 부분 관측 조건 하에서 최초의 하위선형 재해 경계이다.
  • 반반격적 노이즈(확률적 + 적대적) 조건 하에서, 시스템이 알려진 경우 다항로그 T 재해를 달성하고, 시스템이 알려지지 않은 경우 √T 재해를 달성한다 — 둘 다 최적이다.
  • 재해 경계는 이전에 고려된 정적 피드백 정책보다 훨씬 더 풍부한 안정화 가능한 선형 동적 컨트롤러의 전체 클래스와 경쟁한다.
  • 이 프레임워크는 모델이 알려지지 않은 상황에서 온라인 선형 제곱가우시안(LQG) 제어에 대해 최초로 엄밀한 √T 재해 경계를 제공한다.
  • 결과는 일반적인 볼록 손실 함수 및 적대적 편향으로 확장 가능하며, 강건성과 일반성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.